QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

vLLM

Runtime d’inférence

vLLM

vLLM assure un service à haut débit pour la production. Il repose sur PagedAttention, la parallélisation tensorielle et pipeline, la réutilisation gratuite du cache de préfixe et une quantification FP8 ou NVFP4. Son interface reste compatible avec le protocole OpenAI.

Points clés : Production · PagedAttention · Cache de préfixe · Multi-GPU · FP8 et NVFP4 · API OpenAI.

Rôle

vLLM assure un service à haut débit pour la production. Il sert les modèles ouverts derrière une interface compatible avec le protocole OpenAI.

Fonctionnement

Il repose sur PagedAttention, la parallélisation tensorielle et pipeline, la réutilisation gratuite du cache de préfixe et une quantification FP8 ou NVFP4.

Cas d’usage

vLLM sert les charges de production multi-utilisateurs sur serveur GPU, où le débit et le coût par token comptent.

Intégration

Il s’expose à LiteLLM et à la plateforme, et constitue le moteur d’inférence par défaut sur les serveurs RTX PRO 6000 et H200.

En parler avec un spécialiste

Un échange sans engagement.

Réserver un échange

Quels modèles servir avec vLLM ?

Voir l’ensemble des combinaisons de moteur et de modèle.