Quantification : quelle mémoire par format
Le format des poids décide de la mémoire nécessaire plus sûrement que le modèle lui-même.
Réponse courte. Passer de FP16 à NVFP4 divise l’empreinte des poids par 4. 28 pages détaillent chaque modèle dans chaque format.
Combien de mémoire par format ?
La valeur porte sur les poids, marge d’exécution comprise, hors cache d’attention.
Que coûte la quantification ?
- FP16 : pleine précision, référence de qualité.
- FP8 : perte négligeable sur la plupart des tâches.
- NVFP4 : format Blackwell, calcul FP4 natif.
- Q4 : quantification par blocs, large support.
Méthode
Les empreintes sont calculées à partir du nombre de paramètres et du format, avec une marge d’exécution. Elles ne sont pas mesurées sur machine. Le cache d’attention s’ajoute et dépend du contexte et de la concurrence. Les prix sont indicatifs et non contractuels.