Kimi K3
Moonshot AI · l'IA d'entreprise à très grande échelle

Ce que Kimi K3 apporte
Kimi K3 vise l'IA d'entreprise : les charges généralistes, les agents à grande échelle et les documents longs. L'architecture répartit 2800 milliards de paramètres entre 896 experts, dont 16 s'activent par token. Chaque passage avant ne mobilise donc qu'environ 1,8 % des paramètres, ce qui contient le coût de calcul par requête. L'attention hybride Kimi Delta accélère le traitement du contexte long, jusqu'à un million de tokens.
Contrairement à la génération K2, le raisonnement fonctionne en permanence : Moonshot parle de « mode réflexion ». Le modèle comprend nativement les images. Moonshot annonce une efficacité d'échelle (conversion du calcul en capacités) d'environ 2,5 fois celle de K2, et un raisonnement à effort maximal par défaut au lancement, les modes d'effort réduit étant annoncés pour des mises à jour ultérieures.
Fiche technique
| Caractéristique | Valeur |
|---|---|
| Paramètres totaux | 2800 milliards (mélange d'experts) |
| Paramètres actifs par token | 104 milliards (16 experts sur 896) |
| Contexte | 1 million de tokens |
| Modalités | Texte et vision native |
| Raisonnement | Permanent (« mode réflexion ») |
| Attention | Kimi Delta Attention (hybride linéaire) |
| Quantification | Entraînement conscient de la quantification : poids MXFP4, activations MXFP8 |
| Indice Artificial Analysis | 60 points en mode max au 2 septembre 2026, à égalité avec GLM 5.3 en tête des modèles ouverts |
| Poids ouverts | Publiés sur Hugging Face, licence Kimi K3 : 1 561 Go en MXFP4, 93 couches (config.json et dépôt relus le 2 septembre 2026) |
| Tarif API | 3 dollars le million de tokens en entrée, 15 en sortie, 0,30 en cache |
Le positionnement face aux autres modèles ouverts
Au 2 septembre 2026, Kimi K3 partage avec GLM 5.3 la tête des modèles ouverts sur l'indice Artificial Analysis, à 60 points, devant GLM 5.2, jusque-là premier modèle ouvert de la plateforme. Son tarif API le place au niveau des offres américaines de milieu de gamme, au-dessus de DeepSeek V4 et de GLM 5.2 : l'exécution sur site avec cache clé-valeur gratuit renforce d'autant l'intérêt économique de l'auto-hébergement pour les charges agentiques.
Kimi K2.7 Code reste au catalogue pour les assistants de code : plus léger, il maintient des appels d'outils stables sur les longues sessions. K3 le complète sur les charges généralistes, multimodales et de raisonnement.
Au niveau des modèles frontière
L'indice Artificial Analysis crédite Kimi K3 de 60 points en mode max au 2 septembre 2026, contre 66 pour Claude Fable 5.1 et 63 pour Claude Opus 5. Un modèle à poids ouverts se mesure donc aux systèmes fermés de tête.
Sur l'endurance, Moonshot publie ses résultats sur les bancs d'essai d'automatisation de tâches réelles (SpreadsheetBench 2, OfficeQA Pro, BrowseComp, Terminal-Bench 2.1) et un score de 90,4 sur une évaluation à un million de tokens sans gestion de contexte. Ces charges longues, où un agent enchaîne des centaines d'étapes sans perdre le fil, correspondent aux usages d'entreprise que le modèle vise.
Une réserve de méthode s'applique : ces chiffres proviennent de Moonshot ou de mesures via l'API, et la publication des poids permet désormais de les reproduire de façon indépendante.
Moins de refus pour la recherche et les métiers réglementés
Les premiers retours d'usage soulignent un comportement moins restrictif que celui des API fermées sur les domaines professionnels : un chercheur en biologie, un juriste ou un médecin obtient des réponses de fond là où d'autres modèles refusent la question ou la renvoient vers un modèle réduit. Pour les équipes de recherche et les métiers réglementés, le modèle sert alors de véritable interlocuteur de travail, dans le cadre du droit applicable et de la déontologie de chaque profession.
Les poids ouverts prolongent cette liberté : l'exploitant audite le comportement du modèle, l'ajuste par entraînement complémentaire et pose ses propres garde-fous applicatifs, au niveau de la passerelle LiteLLM ou du harnais d'agent. La politique d'usage appartient à l'organisation qui déploie, sous sa responsabilité, et non à l'éditeur du modèle.
L'exécuter sur site
Le modèle complet demande un cluster de serveurs H200, B200 ou B300, ou un rack GB300 NVL72 : les 2800 milliards de paramètres doivent résider en mémoire, même si 104 milliards seulement s'activent par token. L'entraînement conscient de la quantification, mené en MXFP4 dès l'ajustement supervisé, prépare le service en 4 bits sans étape de calibration à la charge de l'exploitant. Moonshot recommande des nœuds de 64 accélérateurs et plus, pour garder le trafic entre experts dans un même domaine à haute bande passante. Le moteur vLLM sert ce type d'architecture à mélange d'experts, et la passerelle LiteLLM le rend interchangeable avec les autres modèles de la plateforme : changer de modèle revient à changer une ligne de configuration.
La publication des poids ouvre aussi la voie aux versions distillées : des modèles réduits, entraînés sur les sorties de K3, qui rapprochent une partie de ces capacités d'un poste DGX Spark ou d'une station de travail.
Une réserve subsiste sur la licence : la Kimi K3 License est propre au modèle et ne reprend pas la MIT modifiée de Kimi K2.7 Code, ses conditions d'usage commercial doivent donc être lues avant tout déploiement. QDNA vérifie la licence et les conditions d'usage commercial avant toute mise en production. L'analyse économique entre exécution sur site et API figure dans notre étude sur les coûts du LLM.
Sources officielles
- moonshotai/Kimi-K3, fiche officielle du modèle : licence, paramètres, contexte et format des poids
- Artificial Analysis, indice de comparaison des modèles
Questions fréquentes
Qu'est-ce que Kimi K3 ?
Le modèle phare de Moonshot AI, présenté en juillet 2026 : 2800 milliards de paramètres en mélange d'experts, 104 milliards actifs, contexte d'un million de tokens, vision native et raisonnement permanent. En tête des modèles ouverts sur l'indice Artificial Analysis au 2 septembre 2026, à égalité avec GLM 5.3.
Kimi K3 atteint-il le niveau des modèles fermés ?
L'indice Artificial Analysis le crédite de 60 points en mode max au 2 septembre 2026, contre 66 pour Claude Fable 5.1 et 63 pour Claude Opus 5. Les autres chiffres proviennent de Moonshot ou de mesures via l'API et sont désormais reproductibles depuis la publication des poids.
Kimi K3 est-il un modèle à poids ouverts ?
Oui. Moonshot publie les poids sur Hugging Face sous licence Kimi K3, une licence propre au modèle et non la MIT modifiée de Kimi K2.7 Code. Le modèle reste par ailleurs accessible via l'API de Moonshot.
Quel matériel pour l'exécuter sur site ?
Un cluster H200, B200 ou B300, ou un rack GB300 NVL72 : l'ensemble des poids doit résider en mémoire. La quantification réduit l'empreinte, et l'activation limitée à 104 milliards de paramètres contient le calcul par requête.
Quelle différence avec Kimi K2.7 Code ?
K2.7 Code, environ mille milliards de paramètres, sert les assistants de code et les appels d'outils. K3 triple la taille, ajoute la vision native et le raisonnement permanent, et vise l'IA d'entreprise généraliste et les agents.
Déployer ce modèle chez vous
Sur votre matériel, sans que vos données sortent. QDNA valide la licence, dimensionne le cluster et met en production.
Réserver un échangeSur quelle machine faire tourner Kimi K3 ?
Kimi K3 totalise 2800 milliards de paramètres, soit environ 1 610 Go en NVFP4. 2 plateformes du catalogue disposent d’assez de mémoire.
| Plateforme | Mémoire | Format le plus précis qui loge | Page de dimensionnement |
|---|---|---|---|
| B300 SXM | 2 304 Go | NVFP4 | Kimi K3 sur B300 SXM |
| GB300 NVL72 | 20 700 Go | FP16 | Kimi K3 sur GB300 NVL72 |
Voir aussi Kimi K3 en NVFP4 et la matrice complète.