QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride
Architecture

Runtime d’inférence

Les moteurs qui servent les modèles, du haut débit de production à l’inférence de périphérie, avec le réglage fin et la pile maison dwarfstar.

vLLM

vLLM assure un service a haut débit pour la production.

Triton Inference Server

Triton sert des modèles issus de plusieurs cadres sur une même infrastructure.

Dynamo

Dynamo distribue l’inférence des modèles de raisonnement sur de grandes flottes de GPU.

llama.cpp

llama.cpp reste leger.

Unsloth

Unsloth accéléré le réglage fin d’un facteur deux tout en reduisant la mémoire necessaire, par les methodes LoRA et QLoRA.

dwarfstar

dwarfstar constitue la pile souveraine developpee par QDNA.

Quel moteur choisir ?

Le moteur ne change pas ce que le modèle sait faire, il décide du débit, du nombre de requêtes simultanées et des formats de poids acceptés. Un même modèle servi par deux moteurs différents demande la même mémoire pour ses poids, mais ne rend pas le même service.

MoteurCe qu'il vise Modèles documentés
vLLMservice en production, débit et concurrence7
Triton Inference Servermise en service industrielle, multi-modèles7
Dynamoservice distribué sur plusieurs nœuds7
llama.cppposte de travail et matériel modeste1
Unslothaffinage et quantification5

Quelle mémoire faut-il selon le modèle ?

L'empreinte des poids dépend du modèle et du format, pas du moteur. En NVFP4, elle va de 15,5 Go pour le plus compact à 1 610 Go pour le plus gros des modèles ouverts du catalogue. Le cache d'attention s'ajoute par-dessus et croît avec le contexte servi.

Le détail combinaison par combinaison figure dans la section servir un modèle, et l'empreinte machine par machine dans dimensionnement.

Combinaisons documentées

Voir aussi la comparaison des formats de quantification, qui décide de la mémoire plus sûrement que le modèle lui-même.