Servir Kimi K2.7 Code avec Triton Inference Server
Kimi K2.7 Code compte 1000 milliards de paramètres. Triton Inference Server vise mise en service industrielle, multi-modèles. Cette page donne la mémoire nécessaire et les plateformes qui conviennent.
Quelle mémoire faut-il au minimum ?
Kimi K2.7 Code totalise 1000 milliards de paramètres. En NVFP4, ses poids occupent environ 575 Go, marge d’exécution comprise : 1 000 milliards de paramètres × 0,5 octet (NVFP4) = 500,0 Go de poids ; × 1,15 de marge d’exécution = 575,0 Go. En FP8 l’empreinte double, à environ 1 150 Go (1 000 milliards de paramètres × 1 octet (FP8) = 1 000,0 Go de poids ; × 1,15 de marge d’exécution = 1 150,0 Go.) Le cache d’attention n’est pas calculé sur cette page. Les architectures de ces modèles (attention latente compressée, linéaire ou creuse, couches Mamba) n’ont pas de formule commune par token ; il se mesure sur la machine, avec le contexte et la concurrence visés [À MESURER].
À quoi sert Triton Inference Server ?
Triton Inference Server vise mise en service industrielle, multi-modèles. Voir la fiche Triton Inference Server et la fiche Kimi K2.7 Code.
Sur quelles plateformes ?
- Kimi K2.7 Code sur DGX Station
- Kimi K2.7 Code sur Serveur RTX PRO 6000
- Kimi K2.7 Code sur Serveur H200 SXM
- Kimi K2.7 Code sur B200 SXM
- Kimi K2.7 Code sur B300 SXM
- Kimi K2.7 Code sur GB300 NVL72
Quelle mémoire pour Kimi K2.7 Code avec Triton Inference Server ?
Environ 575 Go en NVFP4 pour les poids, hors cache d’attention.
Triton Inference Server convient-il à Kimi K2.7 Code ?
Triton Inference Server sert Kimi K2.7 Code dès lors que la machine offre au moins 575 Go de mémoire, empreinte des poids en NVFP4. 6 des 8 plateformes du catalogue y parviennent.
Méthode et sources
Les empreintes mémoire sont calculées, elles ne sont pas mesurées : un relevé sur machine peut s’en écarter selon le moteur et le format exact des poids. Chaque valeur ci-dessous porte sa source et la date de son dernier contrôle.
- Kimi K2.7 Code : 1 000 milliards de paramètres, 32 milliards actifs, contexte de 262 144 tokens, licence Modified MIT. Dépôt Hugging Face (config.json, API, carte), vérifié le 2 septembre 2026. 1 billion annoncé (carte), 8 experts activés sur 384 ; le dépôt compte 1 027 milliards d’éléments, publiés en 4 bits (595 Go).
- Octets par paramètre : NVFP4 0,5 (4 bits par paramètre, soit 0,5 octet ; les poids publiés en 4 bits pèsent 0,54 à 0,56 octet par paramètre avec leurs échelles (DeepSeek V4 Pro 865 Go pour 1 599 milliards, Kimi K3 1 561 Go pour 2 780 milliards)) ; FP8 1 (8 bits par paramètre (E4M3), soit 1 octet, échelles par bloc non comptées). Source : connaissance/faits.yaml, famille quantifications, vérifiée le 2026-08-31.
- Marge d’exécution × 1,15 : hypothèse d’exploitation QDNA, non mesurée : 15 % au-dessus des poids pour les activations, les tampons et la fragmentation.
- Seuil « tient » à 75 % de la mémoire : hypothèse QDNA, non mesurée, qui réserve le quart restant au cache d’attention et à la concurrence.