vLLM
Runtime d’inférence

vLLM assure un service à haut débit pour la production. Il repose sur PagedAttention, la parallélisation tensorielle et pipeline, la réutilisation gratuite du cache de préfixe et une quantification FP8 ou NVFP4. Son interface reste compatible avec le protocole OpenAI.
Points clés : Production · PagedAttention · Cache de préfixe · Multi-GPU · FP8 et NVFP4 · API OpenAI.
Rôle
vLLM assure un service à haut débit pour la production. Il sert les modèles ouverts derrière une interface compatible avec le protocole OpenAI.
Fonctionnement
Il repose sur PagedAttention, la parallélisation tensorielle et pipeline, la réutilisation gratuite du cache de préfixe et une quantification FP8 ou NVFP4.
Cas d’usage
vLLM sert les charges de production multi-utilisateurs sur serveur GPU, où le débit et le coût par token comptent.
Intégration
Il s’expose à LiteLLM et à la plateforme, et constitue le moteur d’inférence par défaut sur les serveurs RTX PRO 6000 et H200.
Quels modèles servir avec vLLM ?
Voir l’ensemble des combinaisons de moteur et de modèle.