QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

Dynamo

Runtime d’inférence

Dynamo

Dynamo distribue l’inférence des modèles de raisonnement sur de grandes flottes de GPU. Il sépare les phases de préfixe et de décodage et route selon l’état du cache clé-valeur, ce qui augmente le débit à l’échelle du rack.

Points clés : Désagrégé · Flotte GPU · Séparation préfixe et décodage · Routage cache · Échelle du rack.

Rôle

Dynamo distribue l’inférence des modèles de raisonnement sur de grandes flottes de GPU, à l’échelle du rack.

Fonctionnement

Il sépare les phases de préfixe et de décodage et route les requêtes selon l’état du cache clé-valeur, ce qui augmente le débit global.

Cas d’usage

Dynamo vise les déploiements à forte charge et les modèles de raisonnement gourmands, où une seule machine ne suffit plus.

Intégration

Il orchestre plusieurs instances vLLM et s’insère au-dessus de la couche d’inférence pour les plus grands parcs.

En parler avec un spécialiste

Un échange sans engagement.

Réserver un échange

Quels modèles servir avec Dynamo ?

Voir l’ensemble des combinaisons de moteur et de modèle.