QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride
Architecture

Orchestration multi-agents

Les briques qui transforment les modèles en agents : moteur d’exécution, passerelle, routeur sémantique, connecteurs MCP et mémoire à trois couches.

Hermes Agent

Hermes Agent constitue le moteur d’exécution des agents.

OpenCode

OpenCode orchestre le développement logiciel.

Harness d’agent

Le harness est la boucle d’exécution qui transforme un modèle en agent.

LiteLLM

LiteLLM expose une interface unique devant l’ensemble des modèles, locaux comme distants, ce qui les rend interchangeables.

Routeur sémantique

Le routeur sémantique classe chaque requête avant LiteLLM.

Serveurs MCP privés

Un ensemble de connecteurs MCP auto-hébergés outille les agents : mémoire, recherche documentaire visuelle, rappel du wiki, recherche et lecture web,…

Mémoire à trois couches

La mémoire combine trois couches.

Pour la logique qui choisit, requête par requête, quel modèle traite quoi et ce qui sort de l'entreprise, voir le guide moteur d'orchestration IA : router chaque requête vers le bon modèle.