Servir Kimi K2.7 Code avec Dynamo
Kimi K2.7 Code compte 1000 milliards de paramètres. Dynamo vise service distribué sur plusieurs nœuds. Cette page donne la mémoire nécessaire et les plateformes qui conviennent.
Quelle mémoire faut-il au minimum ?
Kimi K2.7 Code totalise 1000 milliards de paramètres. En NVFP4, ses poids occupent environ 575 Go, marge d’exécution comprise : 1 000 milliards de paramètres × 0,5 octet (NVFP4) = 500,0 Go de poids ; × 1,15 de marge d’exécution = 575,0 Go. En FP8 l’empreinte double, à environ 1 150 Go (1 000 milliards de paramètres × 1 octet (FP8) = 1 000,0 Go de poids ; × 1,15 de marge d’exécution = 1 150,0 Go.) Le cache d’attention n’est pas calculé sur cette page. Les architectures de ces modèles (attention latente compressée, linéaire ou creuse, couches Mamba) n’ont pas de formule commune par token ; il se mesure sur la machine, avec le contexte et la concurrence visés [À MESURER].
À quoi sert Dynamo ?
Dynamo vise service distribué sur plusieurs nœuds. Voir la fiche Dynamo et la fiche Kimi K2.7 Code.
Sur quelles plateformes ?
- Kimi K2.7 Code sur DGX Station
- Kimi K2.7 Code sur Serveur RTX PRO 6000
- Kimi K2.7 Code sur Serveur H200 SXM
- Kimi K2.7 Code sur B200 SXM
- Kimi K2.7 Code sur B300 SXM
- Kimi K2.7 Code sur GB300 NVL72
Quelle mémoire pour Kimi K2.7 Code avec Dynamo ?
Environ 575 Go en NVFP4 pour les poids, hors cache d’attention.
Dynamo convient-il à Kimi K2.7 Code ?
Dynamo sert Kimi K2.7 Code dès lors que la machine offre au moins 575 Go de mémoire, empreinte des poids en NVFP4. 6 des 8 plateformes du catalogue y parviennent.
Méthode et sources
Les empreintes mémoire sont calculées, elles ne sont pas mesurées : un relevé sur machine peut s’en écarter selon le moteur et le format exact des poids. Chaque valeur ci-dessous porte sa source et la date de son dernier contrôle.
- Kimi K2.7 Code : 1 000 milliards de paramètres, 32 milliards actifs, contexte de 262 144 tokens, licence Modified MIT. Dépôt Hugging Face (config.json, API, carte), vérifié le 2 septembre 2026. 1 billion annoncé (carte), 8 experts activés sur 384 ; le dépôt compte 1 027 milliards d’éléments, publiés en 4 bits (595 Go).
- Octets par paramètre : NVFP4 0,5 (4 bits par paramètre, soit 0,5 octet ; les poids publiés en 4 bits pèsent 0,54 à 0,56 octet par paramètre avec leurs échelles (DeepSeek V4 Pro 865 Go pour 1 599 milliards, Kimi K3 1 561 Go pour 2 780 milliards)) ; FP8 1 (8 bits par paramètre (E4M3), soit 1 octet, échelles par bloc non comptées). Source : connaissance/faits.yaml, famille quantifications, vérifiée le 2026-08-31.
- Marge d’exécution × 1,15 : hypothèse d’exploitation QDNA, non mesurée : 15 % au-dessus des poids pour les activations, les tampons et la fragmentation.
- Seuil « tient » à 75 % de la mémoire : hypothèse QDNA, non mesurée, qui réserve le quart restant au cache d’attention et à la concurrence.