Dimensionnement : quel modèle sur quelle machine
Cette section confronte 7 modèles ouverts aux 8 plateformes du catalogue.
Quel modèle tient sur quelle machine ?
La case donne le format le plus précis qui loge le modèle sur la machine. Elle mène à la page de détail, qui donne l’empreinte dans les quatre formats et la marge restante.
| Modèle | DGX Spark | Mac Studio Ultra | DGX Station | Serveur RTX PRO 6000 | Serveur H200 SXM | B200 SXM | B300 SXM | GB300 NVL72 |
|---|---|---|---|---|---|---|---|---|
| GLM 5.2 | ne tient pas | NVFP4 | NVFP4 | NVFP4 | FP8 | FP8 | FP16 | FP16 |
| Kimi K3 | ne tient pas | ne tient pas | ne tient pas | ne tient pas | ne tient pas | ne tient pas | NVFP4 | FP16 |
| Kimi K2.7 Code | ne tient pas | ne tient pas | NVFP4 | NVFP4 | NVFP4 | FP8 | FP16 | FP16 |
| DeepSeek V4 | ne tient pas | ne tient pas | ne tient pas | ne tient pas | NVFP4 | NVFP4 | FP8 | FP16 |
| Nemotron 3 Ultra | ne tient pas | NVFP4 | FP8 | FP8 | FP8 | FP16 | FP16 | FP16 |
| MiniMax M3 | ne tient pas | FP8 | FP8 | FP8 | FP16 | FP16 | FP16 | FP16 |
| Qwen 3.6 27B | FP16 | FP16 | FP16 | FP16 | FP16 | FP16 | FP16 | FP16 |
Comment lire ces valeurs ?
L’empreinte porte sur les poids du modèle. Dans une architecture à mélange d’experts, tous les experts restent chargés en mémoire même si une fraction seulement calcule à chaque jeton : les paramètres actifs gouvernent la vitesse, pas l’occupation. Le cache d’attention s’ajoute par-dessus et croît avec le contexte et le nombre de requêtes simultanées.
Méthode
Les empreintes sont calculées à partir du nombre de paramètres et du format, avec une marge d’exécution. Elles ne sont pas mesurées sur machine. Le cache d’attention s’ajoute et dépend du contexte et de la concurrence. Les prix sont indicatifs et non contractuels.