Servir un modèle : quel moteur pour quel modèle
Le moteur décide du débit, de la concurrence et des formats acceptés.
Réponse courte. 27 combinaisons de moteur et de modèle sont documentées. Chaque page donne la mémoire minimale et les plateformes qui y parviennent.
Par moteur
Dynamo
Dynamo vise service distribué sur plusieurs nœuds.
Triton Inference Server
Triton Inference Server vise mise en service industrielle, multi-modèles.
vLLM
vLLM vise service en production, débit et concurrence.
Unsloth
Unsloth vise affinage et quantification.
llama.cpp
llama.cpp vise poste de travail et matériel modeste.
Méthode
Les empreintes sont calculées à partir du nombre de paramètres et du format, avec une marge d’exécution. Elles ne sont pas mesurées sur machine. Le cache d’attention s’ajoute et dépend du contexte et de la concurrence. Les prix sont indicatifs et non contractuels.