Dimensionnement : quel modèle sur quelle machine
Cette section confronte 7 modèles ouverts aux 8 plateformes du catalogue.
Quel modèle tient sur quelle machine ?
La case donne le format le plus précis qui loge le modèle sur la machine. Elle mène à la page de détail, qui donne l’empreinte dans les quatre formats et la marge restante.
| Modèle | DGX Spark | Mac Studio Ultra | DGX Station | Serveur RTX PRO 6000 | Serveur H200 SXM | B200 SXM | B300 SXM | GB300 NVL72 |
|---|---|---|---|---|---|---|---|---|
| GLM 5.2 | ne tient pas | NVFP4 | NVFP4 | NVFP4 | FP8 | FP8 | FP16 | FP16 |
| Kimi K3 | ne tient pas | ne tient pas | ne tient pas | ne tient pas | ne tient pas | ne tient pas | NVFP4 | FP16 |
| Kimi K2.7 Code | ne tient pas | ne tient pas | NVFP4 | NVFP4 | NVFP4 | FP8 | FP16 | FP16 |
| DeepSeek V4 | ne tient pas | ne tient pas | ne tient pas | ne tient pas | NVFP4 | NVFP4 | FP8 | FP16 |
| Nemotron 3 Ultra | ne tient pas | NVFP4 | FP8 | FP8 | FP8 | FP16 | FP16 | FP16 |
| MiniMax M3 | ne tient pas | FP8 | FP8 | FP8 | FP16 | FP16 | FP16 | FP16 |
| Qwen 3.8 27B | FP16 | FP16 | FP16 | FP16 | FP16 | FP16 | FP16 | FP16 |
Comment lire ces valeurs ?
L’empreinte porte sur les poids du modèle. Dans une architecture à mélange d’experts, tous les experts restent chargés en mémoire même si une fraction seulement calcule à chaque token : les paramètres actifs gouvernent la vitesse, pas l’occupation. Le cache d’attention s’ajoute par-dessus et croît avec le contexte et le nombre de requêtes simultanées.
Méthode et sources
Les empreintes sont calculées : milliards de paramètres × octets par paramètre du format × 1,15 de marge d’exécution. Elles ne sont pas mesurées sur machine. Le cache d’attention s’ajoute et dépend du contexte et de la concurrence. Les prix sont indicatifs et non contractuels. Chaque page de détail porte ses sources ; les conventions communes sont celles-ci.
- Octets par paramètre : FP16 2 (16 bits par paramètre, soit 2 octets) ; FP8 1 (8 bits par paramètre (E4M3), soit 1 octet, échelles par bloc non comptées) ; NVFP4 0,5 (4 bits par paramètre, soit 0,5 octet ; les poids publiés en 4 bits pèsent 0,54 à 0,56 octet par paramètre avec leurs échelles (DeepSeek V4 Pro 865 Go pour 1 599 milliards, Kimi K3 1 561 Go pour 2 780 milliards)) ; Q4 0,6 (entendu ici comme Q4_K_M de llama.cpp, 0,6 octet par paramètre échelles comprises ; Q4_K_S pèse 0,56, AWQ et GPTQ 0,55). Source : connaissance/faits.yaml, famille quantifications, vérifiée le 2026-08-31.
- Marge d’exécution × 1,15 : hypothèse d’exploitation QDNA, non mesurée : 15 % au-dessus des poids pour les activations, les tampons et la fragmentation.
- Seuil « tient » à 75 % de la mémoire : hypothèse QDNA, non mesurée, qui réserve le quart restant au cache d’attention et à la concurrence.