Triton Inference Server
Runtime d’inférence

Triton sert des modèles issus de plusieurs cadres sur une même infrastructure. Il gère la mise en lot dynamique, les instances concurrentes et le suivi des métriques. Il s’intègre à la pile NVIDIA AI Enterprise.
Points clés : Multi-cadres · Mise en lot dynamique · Instances concurrentes · Métriques · NVIDIA AI Enterprise.
Rôle
Triton Inference Server sert des modèles issus de plusieurs cadres sur une même infrastructure, au-delà des seuls grands modèles de langage.
Fonctionnement
Il gère la mise en lot dynamique, les instances concurrentes et le suivi des métriques, avec un ordonnancement fin des requêtes.
Cas d’usage
Triton convient aux parcs hétérogènes qui mêlent modèles de langage, vision et modèles classiques, sous une console unique.
Intégration
Il s’intègre à la pile NVIDIA AI Enterprise et sert les modèles au format NVFP4 sur GPU Blackwell.
Quels modèles servir avec Triton Inference Server ?
Voir l’ensemble des combinaisons de moteur et de modèle.