Dynamo
Runtime d’inférence

Dynamo distribue l’inférence des modèles de raisonnement sur de grandes flottes de GPU. Il sépare les phases de préfixe et de décodage et route selon l’état du cache clé-valeur, ce qui augmente le débit à l’échelle du rack.
Points clés : Désagrégé · Flotte GPU · Séparation préfixe et décodage · Routage cache · Échelle du rack.
Rôle
Dynamo distribue l’inférence des modèles de raisonnement sur de grandes flottes de GPU, à l’échelle du rack.
Fonctionnement
Il sépare les phases de préfixe et de décodage et route les requêtes selon l’état du cache clé-valeur, ce qui augmente le débit global.
Cas d’usage
Dynamo vise les déploiements à forte charge et les modèles de raisonnement gourmands, où une seule machine ne suffit plus.
Intégration
Il orchestre plusieurs instances vLLM et s’insère au-dessus de la couche d’inférence pour les plus grands parcs.
Quels modèles servir avec Dynamo ?
Voir l’ensemble des combinaisons de moteur et de modèle.