QDNAVente et intégration de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

Servir un modèle : quel moteur pour quel modèle

Le moteur décide du débit, de la concurrence et des formats acceptés.

Réponse courte. 27 combinaisons de moteur et de modèle sont documentées. Chaque page donne la mémoire minimale et les plateformes qui y parviennent.

Par moteur

Dynamo

Dynamo vise service distribué sur plusieurs nœuds.

Triton Inference Server

Triton Inference Server vise mise en service industrielle, multi-modèles.

vLLM

vLLM vise service en production, débit et concurrence.

Unsloth

Unsloth vise affinage et quantification.

llama.cpp

llama.cpp vise poste de travail et matériel modeste.

Méthode

Les empreintes sont calculées à partir du nombre de paramètres et du format, avec une marge d’exécution. Elles ne sont pas mesurées sur machine. Le cache d’attention s’ajoute et dépend du contexte et de la concurrence. Les prix sont indicatifs et non contractuels.