QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride
Architecture

Architecture de la plateforme IA souveraine

Matériel, modèles ouverts, runtime d’inférence et orchestration multi-agents, en fiches détaillées.

Matériel

Du poste DGX Spark au rack GB300 NVL72, huit paliers de puissance.

Modèles ouverts

GLM, Kimi, DeepSeek, Nemotron, MiniMax, Mistral, Qwen : interchangeables via LiteLLM.

Runtime d’inférence

vLLM, Triton, Dynamo, llama.cpp, Unsloth et dwarfstar pour servir les modèles.

Orchestration multi-agents

Harness, LiteLLM, routeur sémantique, MCP et mémoire à trois couches.

API externes

OpenAI, Anthropic, Azure, Bedrock, OpenRouter : le débord hybride maîtrisé.

Local souverain, hébergé ou hybride : quel mode choisir ?

La plateforme se déploie de trois façons. Le choix dépend des données, de la conformité visée et de la salle disponible. Le détail des coûts figure dans sur site ou API et dans le guide des prix.

CritèreLocal souverainHébergé souverainHybride
Donnéesrestent dans vos murs, sur votre matérielrestent en France, dans un datacenter managé soumis au droit français et européenle confidentiel reste local, seul le contenu banal peut déborder
ConformitéRGPD, HDS et objectifs SecNumCloud par constructionportée par l'hébergeur managé, sous droit français et européenle routeur sémantique classe chaque requête avant l'appel
Coûtmatériel amorti, cache clé-valeur gratuit sous vLLMredevance d'infogérance prévisible, sans investissement initial lourdlocal amorti, débord facturé au token
Montée en chargepar ajout de GPU ou de nœuds sur sitepar paliers, à la demande auprès de l'hébergeurimmédiate sur les API externes
Profil typiqueTPE à grande entreprise avec une baie ou une salleorganisations sans salle serveurpics d'usage et contenus publics

Une plateforme conçue, déployée et opérée selon cette méthode tourne déjà en production : gironde.qdna.fr, la réalisation Gironde.