QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

Routeur sémantique

Orchestration multi-agents

Routeur sémantique

Le routeur sémantique classe chaque requête avant LiteLLM. Par similarité d’embeddings, il distingue le contenu confidentiel du contenu public, puis oriente la demande vers un modèle souverain local ou vers un modèle externe. Ce filtrage prévient la fuite de données.

Points clés : Classification par embeddings · Confidentiel ou public · Prévention de fuite · Orientation par tâche · En amont de LiteLLM.

Classification par embeddings

Le routeur calcule la similarité de chaque requête avec des références, puis la catégorise avant tout appel modèle. La décision s’appuie sur le sens du texte, pas sur de simples mots-clés.

Confidentiel ou public

Le routeur distingue le contenu sensible du contenu banal. Le sensible reste sur un modèle souverain local, tandis que le reste peut déborder vers une API externe quand cela accélère ou réduit le coût.

Prévention de fuite

Ce filtrage empêche que des données confidentielles quittent l’infrastructure. La politique de l’organisation s’applique avant l’exécution, et non après coup.

Orientation par tâche

Au-delà de la sensibilité, le routeur oriente selon la nature de la demande, code, raisonnement ou contexte long, vers le modèle le mieux adapté du catalogue.

En amont de LiteLLM

Le routeur se place devant la passerelle. Le filtrage reste transparent pour les applications, qui continuent d’appeler une seule interface.

En parler avec un spécialiste

Un échange sans engagement.

Réserver un échange

Le routeur sémantique n'est qu'une pièce : le guide moteur d'orchestration IA détaille comment il s'articule avec les règles déterministes et la passerelle.