QDNAVente et intégration de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

Dimensionnement : quel modèle sur quelle machine

Cette section confronte 7 modèles ouverts aux 8 plateformes du catalogue.

Réponse courte. 41 combinaisons de modèle et de machine aboutissent à une configuration qui tient. La matrice ci-dessous donne, pour chacune, le format le plus précis qui loge le modèle.

Quel modèle tient sur quelle machine ?

La case donne le format le plus précis qui loge le modèle sur la machine. Elle mène à la page de détail, qui donne l’empreinte dans les quatre formats et la marge restante.

ModèleDGX SparkMac Studio UltraDGX StationServeur RTX PRO 6000Serveur H200 SXMB200 SXMB300 SXMGB300 NVL72
GLM 5.2ne tient pasNVFP4NVFP4NVFP4FP8FP8FP16FP16
Kimi K3ne tient pasne tient pasne tient pasne tient pasne tient pasne tient pasNVFP4FP16
Kimi K2.7 Codene tient pasne tient pasNVFP4NVFP4NVFP4FP8FP16FP16
DeepSeek V4ne tient pasne tient pasne tient pasne tient pasNVFP4NVFP4FP8FP16
Nemotron 3 Ultrane tient pasNVFP4FP8FP8FP8FP16FP16FP16
MiniMax M3ne tient pasFP8FP8FP8FP16FP16FP16FP16
Qwen 3.6 27BFP16FP16FP16FP16FP16FP16FP16FP16

Comment lire ces valeurs ?

L’empreinte porte sur les poids du modèle. Dans une architecture à mélange d’experts, tous les experts restent chargés en mémoire même si une fraction seulement calcule à chaque jeton : les paramètres actifs gouvernent la vitesse, pas l’occupation. Le cache d’attention s’ajoute par-dessus et croît avec le contexte et le nombre de requêtes simultanées.

Méthode

Les empreintes sont calculées à partir du nombre de paramètres et du format, avec une marge d’exécution. Elles ne sont pas mesurées sur machine. Le cache d’attention s’ajoute et dépend du contexte et de la concurrence. Les prix sont indicatifs et non contractuels.