QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

Dimensionnement : quel modèle sur quelle machine

Cette section confronte 7 modèles ouverts aux 8 plateformes du catalogue.

Réponse courte. 41 combinaisons de modèle et de machine aboutissent à une configuration qui tient. La matrice ci-dessous donne, pour chacune, le format le plus précis qui loge le modèle.

Quel modèle tient sur quelle machine ?

La case donne le format le plus précis qui loge le modèle sur la machine. Elle mène à la page de détail, qui donne l’empreinte dans les quatre formats et la marge restante.

ModèleDGX SparkMac Studio UltraDGX StationServeur RTX PRO 6000Serveur H200 SXMB200 SXMB300 SXMGB300 NVL72
GLM 5.2ne tient pasNVFP4NVFP4NVFP4FP8FP8FP16FP16
Kimi K3ne tient pasne tient pasne tient pasne tient pasne tient pasne tient pasNVFP4FP16
Kimi K2.7 Codene tient pasne tient pasNVFP4NVFP4NVFP4FP8FP16FP16
DeepSeek V4ne tient pasne tient pasne tient pasne tient pasNVFP4NVFP4FP8FP16
Nemotron 3 Ultrane tient pasNVFP4FP8FP8FP8FP16FP16FP16
MiniMax M3ne tient pasFP8FP8FP8FP16FP16FP16FP16
Qwen 3.8 27BFP16FP16FP16FP16FP16FP16FP16FP16

Comment lire ces valeurs ?

L’empreinte porte sur les poids du modèle. Dans une architecture à mélange d’experts, tous les experts restent chargés en mémoire même si une fraction seulement calcule à chaque token : les paramètres actifs gouvernent la vitesse, pas l’occupation. Le cache d’attention s’ajoute par-dessus et croît avec le contexte et le nombre de requêtes simultanées.

Méthode et sources

Les empreintes sont calculées : milliards de paramètres × octets par paramètre du format × 1,15 de marge d’exécution. Elles ne sont pas mesurées sur machine. Le cache d’attention s’ajoute et dépend du contexte et de la concurrence. Les prix sont indicatifs et non contractuels. Chaque page de détail porte ses sources ; les conventions communes sont celles-ci.

  • Octets par paramètre : FP16 2 (16 bits par paramètre, soit 2 octets) ; FP8 1 (8 bits par paramètre (E4M3), soit 1 octet, échelles par bloc non comptées) ; NVFP4 0,5 (4 bits par paramètre, soit 0,5 octet ; les poids publiés en 4 bits pèsent 0,54 à 0,56 octet par paramètre avec leurs échelles (DeepSeek V4 Pro 865 Go pour 1 599 milliards, Kimi K3 1 561 Go pour 2 780 milliards)) ; Q4 0,6 (entendu ici comme Q4_K_M de llama.cpp, 0,6 octet par paramètre échelles comprises ; Q4_K_S pèse 0,56, AWQ et GPTQ 0,55). Source : connaissance/faits.yaml, famille quantifications, vérifiée le 2026-08-31.
  • Marge d’exécution × 1,15 : hypothèse d’exploitation QDNA, non mesurée : 15 % au-dessus des poids pour les activations, les tampons et la fragmentation.
  • Seuil « tient » à 75 % de la mémoire : hypothèse QDNA, non mesurée, qui réserve le quart restant au cache d’attention et à la concurrence.