QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride
Le blog QDNA

Inférence et entraînement de LLM en local ou hybride, expliqués

Des analyses courtes et vérifiées sur les plateformes IA sur site, les modèles ouverts, les coûts LLM, l'agentique et la conformité française et européenne.

Matériel

Qwen3.8-Flash-Next sur Mac Studio M5 Ultra : 112 Go de poids, un million de tokens

180 milliards de paramètres dont 6 actifs, 111,6 Go mesurés en MLX 4 bits, et un cache de 24 Kio par token.

Publié le 30 août 2026 · 9 min de lecture
Matériel

GLM-5.3-Flash sur Mac Studio M5 Ultra : 320 milliards de paramètres dans 512 Go

334,1 Go mesurés en MLX 8 bits, 11 Kio de cache par token, fenêtre déclarée d’un million de tokens.

Publié le 30 août 2026 · 9 min de lecture
Architecture

Patterns RAG avancés en entreprise : ce qui sépare une démo d'un système qui tient

Le RAG naïf ne tombe jamais en panne : il répond, avec le mauvais extrait. Cinq patterns, et l'ordre dans lequel les poser.

Publié le 28 août 2026 · 11 min de lecture
Conformité

Données sensibles et IA : ce qu'une politique de zéro rétention garantit vraiment

La clause porte sur la conservation, jamais sur la transmission. Les quatre endroits où la donnée se dépose quand même, et ce que le local change.

Publié le 28 août 2026 · 9 min de lecture
Conformité

Traduction juridique et IA : traduire un contrat sans le publier

Le seul usage de l'IA qui transmet le document entier. Pourquoi un contrat de sous-traitance n'y répond qu'à moitié, et comment traduire sur site.

Publié le 28 août 2026 · 9 min de lecture
Conformité

Chatbot IA et RGPD : les quatre obligations qui se règlent dans l'architecture

Informer, fonder, limiter, prouver : trois de ces quatre obligations se décident dans l'architecture, et la quatrième découle des trois autres.

Publié le 28 août 2026 · 10 min de lecture
Orchestration

Moteur d'orchestration IA : router chaque requête vers le bon modèle

Classifieur, politique de routage, passerelle : les trois pièces qui décident du coût, de la latence et de ce qui sort de l'entreprise.

Publié le 28 août 2026 · 10 min de lecture
Matériel

Mac Studio M5 Ultra : 512 Go à 1,2 To/s, ce que ça change pour un LLM local

+47 % de bande passante, 512 Go inchangés. Quels modèles Flash y logent vraiment, et ce que la quantification MLX coûte en qualité : perplexité mesurée à l'appui.

Publié le 28 août 2026 · 11 min de lecture
Matériel

ASRock AI BOX-A395 + Qwen3.8-27B : 256K de contexte sur Strix Halo 128 GB

ASRock AI BOX-A395 (Ryzen AI Max+ 395, Radeon 8060S, 128 GB LPDDR5X-8000 partagée) fait tourner Qwen3.8-27B multimodal en local. Benchmarks mesurés llama.cpp + ROCm, KV cache, fenêtres de contexte 262k natives, OS, comparatif prix.

Publié le 20 août 2026 · 7 min de lecture
Matériel

Qwen3.8-27B en local : 262 144 tokens de contexte sur une seule machine

Architecture hybride Gated DeltaNet, cache KV de 64 Kio par token, contexte natif 262 144 : le dimensionnement réel, carte par carte.

Publié le 18 août 2026 · 8 min de lecture
Modèles

GLM 5.3 deep on-premise : quel matériel, à quelle vitesse ?

Étude complète GLM 5.3 de Zhipu AI : architecture MoE 744B (20B actifs), contexte 200 K, quantifications NVFP4/FP8/FP16, débit sur DGX Spark, DGX Station, H200, B200, B300, GB300 NVL72, comparatif DeepSeek V4 Flash, Kimi K3, Qwen 3.8, Claude Opus 5, GPT-5.5.

Publié le 18 août 2026 · 10 min de lecture
Matériel

DeepSeek V4 Flash 0731 sur DGX Station et cluster 2× DGX Spark

Faire tourner le dernier modèle DeepSeek (284B, 13B actifs, 1M contexte, FP4+FP8) en local sur DGX Spark, cluster 2× Spark et DGX Station GB300 avec vLLM 0.25+. Recettes, prix, benchmarks.

Publié le 2 août 2026 · 11 min de lecture
Modèles

Benchmark indépendant : DeepSeek V4 Flash 0731 vs Claude Opus 5 vs GPT-5.5

Benchmark 2026 : DeepSeek V4 Flash 0731 (284B, 13B actifs, 1M contexte) vs Claude Opus 5 vs GPT-5.5. MMLU-Pro, GPQA, AIME, Terminal Bench, coût par token et souveraineté.

Publié le 2 août 2026 · 10 min de lecture
Modèles

Benchmark indépendant des modèles open weight 2026

Benchmark 2026 des modèles open weight : DeepSeek V4 Flash 0731 (284B/13B actifs, 1M contexte), GLM 5.2 (744B), Qwen 3.7 (235B), MiniMax M3 (428B), Llama 3.1 70B (70B). MMLU-Pro, GPQA, AIME, Terminal Bench, coût par token et souveraineté.

Publié le 2 août 2026 · 11 min de lecture
Cas d'usage

Étude de cas : DeepSeek V4 Flash 0731 sur DGX Station pour une PME

Étude de cas client : déploiement de DeepSeek V4 Flash 0731 sur DGX Station GB300 pour une PME française. Benchmarks réels, coûts, ROI 18 mois et leçons apprises.

Publié le 2 août 2026 · 8 min de lecture
Modèles

Modèles open weight pour déploiement local 2026 : comparatif complet

Comparatif 2026 des meilleurs modèles open weight pour déploiement local : DeepSeek V4 Flash 0731, Kimi K3, GLM 5.2, Qwen 3.7, MiniMax M3, Llama 3.1 70B. Taille, contexte, licence, performance, coût et souveraineté.

Publié le 2 août 2026 · 12 min de lecture
Orchestration

Couche sémantique et ontologie pour agents IA

Le substrat qui rend les agents fiables : ontologie, knowledge graph, enforcement eBPF au noyau et déploiement serverless souverain.

Publié le 23 juillet 2026 · 9 min de lecture
Modèles

Qwen3.8-Max-Preview : 2 400 milliards de paramètres, et des questions

Alibaba tease un modèle géant sans rapport technique ni benchmark indépendant. Ce que l'annonce change, et ne change pas, pour un LLM local.

Publié le 21 juillet 2026 · 6 min de lecture
Stratégie

Kill switch et LLM local : ce que change le rapport parlementaire n° 3054

L'accès à deux modèles d'IA majeurs suspendu sur ordre des autorités américaines, et un crédit d'impôt open source proposé pour les PME.

Publié le 19 juillet 2026 · 8 min de lecture
Matériel

Prefill, decode et cache KV : quel matériel pour un LLM

Pourquoi la bande passante mémoire décide de la vitesse, et quand NVLink, SXM ou un cluster changent la donne.

Publié le 18 juillet 2026 · 10 min de lecture
Guides

Faire tourner une IA en local sur votre PC

Du PC gratuit au mini-supercalculateur DGX Spark et l'écosystème GB10 (ASUS, Dell, Lenovo, MSI, Acer).

Publié le 18 juillet 2026 · 9 min de lecture
Guides

RAG en entreprise : brancher l'IA sur vos documents

Découpage, recherche hybride, reranking et contrôle d'accès : le pipeline pour brancher un LLM sur vos documents, en local.

Publié le 18 juillet 2026 · 9 min de lecture
Conformité

IA générative et RGPD : la reprise de contrôle

Ce que recommande la CNIL, le risque extraterritorial, et comment l'IA locale rend le contrôle des données à l'entreprise.

Publié le 18 juillet 2026 · 8 min de lecture
Matériel

Quel serveur pour l'IA ? Guide et prix par gamme

Des fourchettes de prix par gamme, du poste au rack, dans un marché de mémoire tendu qui tire les coûts vers le haut.

Publié le 18 juillet 2026 · 8 min de lecture
Modèles

LLM local : quel modèle d'IA open source choisir ?

GLM, DeepSeek, Kimi, Mistral, Qwen : comparatif 2026 des modèles à poids ouverts, par usage, matériel et licence.

Publié le 18 juillet 2026 · 9 min de lecture
Guides

Installer un LLM local en entreprise : le guide

Les cinq décisions : modèle, matériel (NVIDIA, HPE, Dell, Supermicro, Lenovo), runtime, passerelle et sécurité.

Publié le 18 juillet 2026 · 8 min de lecture
Agentique

Orchestrer plusieurs agents de code en parallèle

Du poste unique à la flotte pilotée : un agent superviseur délègue aux sous-agents et la revue devient le seul vrai goulot.

Publié le 18 juillet 2026 · 9 min de lecture
Format ouvert

Open Knowledge Format : un format ouvert pour la mémoire des agents IA

Le standard ouvert OKF représente la connaissance des agents en Markdown : portable, versionnable et interopérable, sans lock-in.

Publié le 17 juillet 2026 · 8 min de lecture
Cas d'usage

Chatbot d'entreprise : le cas d'usage du ChatGPT interne

Un ChatGPT interne branché sur vos documents par RAG, conforme au RGPD et hébergé en local : support, RH, juridique, service client.

Publié le 16 juillet 2026 · 8 min de lecture
Cas d'usage

Coder avec l'IA sur un modèle local via LiteLLM

Des assistants de code sur modèles ouverts locaux : le code reste dans l'infrastructure, le cache clé-valeur reste gratuit.

Publié le 16 juillet 2026 · 9 min de lecture
Cas d'usage

IA pour les applications métier : CRM, support, ERP, documents

Une API IA interne unique avec clés virtuelles, budgets et télémétrie par application, au lieu d'un fournisseur par outil.

Publié le 16 juillet 2026 · 9 min de lecture
Fondamentaux

Qu'est-ce qu'une plateforme IA souveraine ?

Définition, différence entre local et hybride, matériel, modèles ouverts et conformité. Le guide de référence pour cadrer un projet.

Publié le 5 juillet 2026 · 7 min de lecture
Coûts

Sur site ou API : à partir de combien d'utilisateurs le LLM local est-il rentable ?

Le point de bascule des coûts LLM, le rôle du cache clé-valeur et la comparaison avec le paiement au token.

Publié le 5 juillet 2026 · 10 min de lecture
Méthode

De votre serveur GPU à un service LLM en production

La méthode en sept phases, avec un livrable et un critère de sortie mesurable par phase.

Publié le 5 juillet 2026 · 11 min de lecture
Agentique

D'un chatbot à une plateforme agentique

Le harness, la mémoire à trois couches et les skills qui transforment un modèle en agent utile.

Publié le 5 juillet 2026 · 10 min de lecture
Exploitation

Les pièges de la mise en production d'un LLM sur site

Huit erreurs qui se paient cher, et la mesure qui évite chacune. Des retours de terrain.

Publié le 5 juillet 2026 · 9 min de lecture