QDNAVente et intégration de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

Quantification : quelle mémoire par format

Le format des poids décide de la mémoire nécessaire plus sûrement que le modèle lui-même.

Réponse courte. Passer de FP16 à NVFP4 divise l’empreinte des poids par 4. 28 pages détaillent chaque modèle dans chaque format.

Combien de mémoire par format ?

La valeur porte sur les poids, marge d’exécution comprise, hors cache d’attention.

ModèleMilliards de paramètresFP16FP8 NVFP4Q4
GLM 5.27441 711 Go856 Go428 Go428 Go
Kimi K328006 440 Go3 220 Go1 610 Go1 610 Go
Kimi K2.7 Code10002 300 Go1 150 Go575 Go575 Go
DeepSeek V416003 680 Go1 840 Go920 Go920 Go
Nemotron 3 Ultra5501 265 Go632 Go316 Go316 Go
MiniMax M3428984 Go492 Go246 Go246 Go
Qwen 3.6 27B2762,1 Go31,0 Go15,5 Go15,5 Go

Que coûte la quantification ?

  • FP16 : pleine précision, référence de qualité.
  • FP8 : perte négligeable sur la plupart des tâches.
  • NVFP4 : format Blackwell, calcul FP4 natif.
  • Q4 : quantification par blocs, large support.

Méthode

Les empreintes sont calculées à partir du nombre de paramètres et du format, avec une marge d’exécution. Elles ne sont pas mesurées sur machine. Le cache d’attention s’ajoute et dépend du contexte et de la concurrence. Les prix sont indicatifs et non contractuels.