Servir un modèle : quel moteur pour quel modèle
Le moteur décide du débit, de la concurrence et des formats acceptés.
Réponse courte. 27 combinaisons de moteur et de modèle sont documentées. Chaque page donne la mémoire minimale et les plateformes qui y parviennent.
Par moteur
Dynamo
Dynamo vise service distribué sur plusieurs nœuds.
Triton Inference Server
Triton Inference Server vise mise en service industrielle, multi-modèles.
vLLM
vLLM vise service en production, débit et concurrence.
Unsloth
Unsloth vise affinage et quantification.
llama.cpp
llama.cpp vise poste de travail et matériel modeste.
Méthode et sources
Les empreintes sont calculées : milliards de paramètres × octets par paramètre du format × 1,15 de marge d’exécution. Elles ne sont pas mesurées sur machine. Le cache d’attention s’ajoute et dépend du contexte et de la concurrence. Les prix sont indicatifs et non contractuels. Chaque page de détail porte ses sources ; les conventions communes sont celles-ci.
- Octets par paramètre : FP16 2 (16 bits par paramètre, soit 2 octets) ; FP8 1 (8 bits par paramètre (E4M3), soit 1 octet, échelles par bloc non comptées) ; NVFP4 0,5 (4 bits par paramètre, soit 0,5 octet ; les poids publiés en 4 bits pèsent 0,54 à 0,56 octet par paramètre avec leurs échelles (DeepSeek V4 Pro 865 Go pour 1 599 milliards, Kimi K3 1 561 Go pour 2 780 milliards)) ; Q4 0,6 (entendu ici comme Q4_K_M de llama.cpp, 0,6 octet par paramètre échelles comprises ; Q4_K_S pèse 0,56, AWQ et GPTQ 0,55). Source : connaissance/faits.yaml, famille quantifications, vérifiée le 2026-08-31.
- Marge d’exécution × 1,15 : hypothèse d’exploitation QDNA, non mesurée : 15 % au-dessus des poids pour les activations, les tampons et la fragmentation.
- Seuil « tient » à 75 % de la mémoire : hypothèse QDNA, non mesurée, qui réserve le quart restant au cache d’attention et à la concurrence.