LiteLLM
Orchestration multi-agents

LiteLLM expose une interface unique devant l’ensemble des modèles, locaux comme distants, ce qui les rend interchangeables. Il assure le routage, les alias, les clés virtuelles par utilisateur et par équipe, les quotas, le suivi des coûts et la journalisation.
Points clés : Passerelle unifiée · Routage et bascule · Clés virtuelles · Budgets et quotas · Suivi des coûts · Observabilité · Garde-fous · Cache Redis.
Passerelle unifiée
LiteLLM présente une interface unique compatible avec le protocole OpenAI devant plus de cent fournisseurs. Un même appel client atteint un modèle local servi par vLLM ou llama.cpp comme une API distante OpenAI, Anthropic, Amazon Bedrock, Azure ou OpenRouter, sans modifier le code applicatif.
Routage, bascule et alias
La passerelle répartit la charge entre plusieurs instances d’un même modèle et bascule vers un modèle de secours en cas d’erreur ou de saturation. Elle gère les tentatives, les délais et les périodes de refroidissement. Un alias de groupe réunit plusieurs modèles derrière un seul nom logique, ce qui permet de changer de fournisseur sans toucher aux clients.
Clés virtuelles, budgets et quotas
Chaque utilisateur ou équipe reçoit une clé virtuelle assortie d’un budget, de limites de tokens et de requêtes par minute, et d’une liste de modèles autorisés. Les clés des fournisseurs restent masquées derrière la passerelle. Un dépassement de budget bloque la clé.
Suivi des coûts
LiteLLM calcule le coût de chaque appel et l’agrège par clé, par utilisateur, par équipe et par modèle. L’historique de consommation alimente le suivi budgétaire et les tableaux de bord, avec réinitialisation selon la période retenue.
Observabilité et journalisation
Chaque requête et chaque réponse sont journalisées et exportées vers Langfuse, Prometheus ou des rappels personnalisés. Le suivi couvre la latence, le débit, les erreurs et le détail des appels d’outils, ce qui rend l’usage traçable et auditable.
Garde-fous, cache et administration
Des greffons pré et post-appel filtrent les entrées et les sorties, appliquent des règles de confidentialité et écartent les contenus sensibles. Un cache Redis mutualise les réponses identiques et réduit le coût et la latence. Une interface d’administration et une API gèrent les clés, les budgets et les modèles. La passerelle s’auto-héberge et garde les secrets sur l’infrastructure souveraine.
La passerelle exécute une décision prise en amont : voir comment router chaque requête vers le bon modèle.