vLLM
vLLM assure un service a haut débit pour la production.
Triton Inference Server
Triton sert des modèles issus de plusieurs cadres sur une même infrastructure.
Dynamo
Dynamo distribue l’inférence des modèles de raisonnement sur de grandes flottes de GPU.
llama.cpp
llama.cpp reste leger.
Unsloth
Unsloth accéléré le réglage fin d’un facteur deux tout en reduisant la mémoire necessaire, par les methodes LoRA et QLoRA.
dwarfstar
dwarfstar constitue la pile souveraine developpee par QDNA.
Quel moteur choisir ?
Le moteur ne change pas ce que le modèle sait faire, il décide du débit, du nombre de requêtes simultanées et des formats de poids acceptés. Un même modèle servi par deux moteurs différents demande la même mémoire pour ses poids, mais ne rend pas le même service.
| Moteur | Ce qu'il vise | Modèles documentés |
|---|---|---|
| vLLM | service en production, débit et concurrence | 7 |
| Triton Inference Server | mise en service industrielle, multi-modèles | 7 |
| Dynamo | service distribué sur plusieurs nœuds | 7 |
| llama.cpp | poste de travail et matériel modeste | 1 |
| Unsloth | affinage et quantification | 5 |
Quelle mémoire faut-il selon le modèle ?
L'empreinte des poids dépend du modèle et du format, pas du moteur. En NVFP4, elle va de 15,5 Go pour le plus compact à 1 610 Go pour le plus gros des modèles ouverts du catalogue. Le cache d'attention s'ajoute par-dessus et croît avec le contexte servi.
Le détail combinaison par combinaison figure dans la section servir un modèle, et l'empreinte machine par machine dans dimensionnement.
Combinaisons documentées
- DeepSeek V4 avec Dynamo
- DeepSeek V4 avec Triton Inference Server
- DeepSeek V4 avec vLLM
- GLM 5.2 avec Dynamo
- GLM 5.2 avec Triton Inference Server
- GLM 5.2 avec Unsloth
- GLM 5.2 avec vLLM
- Kimi K2.7 Code avec Dynamo
- Kimi K2.7 Code avec Triton Inference Server
- Kimi K2.7 Code avec Unsloth
Voir aussi la comparaison des formats de quantification, qui décide de la mémoire plus sûrement que le modèle lui-même.