Qwen3.8-Flash-Next sur Mac Studio M5 Ultra : 112 Go de poids, un million de tokens
180 milliards de paramètres dont 6 actifs, 111,6 Go mesurés en MLX 4 bits, et un cache de 24 Kio par token.
GLM-5.3-Flash sur Mac Studio M5 Ultra : 320 milliards de paramètres dans 512 Go
334,1 Go mesurés en MLX 8 bits, 11 Kio de cache par token, fenêtre déclarée d’un million de tokens.
Patterns RAG avancés en entreprise : ce qui sépare une démo d'un système qui tient
Le RAG naïf ne tombe jamais en panne : il répond, avec le mauvais extrait. Cinq patterns, et l'ordre dans lequel les poser.
Données sensibles et IA : ce qu'une politique de zéro rétention garantit vraiment
La clause porte sur la conservation, jamais sur la transmission. Les quatre endroits où la donnée se dépose quand même, et ce que le local change.
Traduction juridique et IA : traduire un contrat sans le publier
Le seul usage de l'IA qui transmet le document entier. Pourquoi un contrat de sous-traitance n'y répond qu'à moitié, et comment traduire sur site.
Chatbot IA et RGPD : les quatre obligations qui se règlent dans l'architecture
Informer, fonder, limiter, prouver : trois de ces quatre obligations se décident dans l'architecture, et la quatrième découle des trois autres.
Moteur d'orchestration IA : router chaque requête vers le bon modèle
Classifieur, politique de routage, passerelle : les trois pièces qui décident du coût, de la latence et de ce qui sort de l'entreprise.
Mac Studio M5 Ultra : 512 Go à 1,2 To/s, ce que ça change pour un LLM local
+47 % de bande passante, 512 Go inchangés. Quels modèles Flash y logent vraiment, et ce que la quantification MLX coûte en qualité : perplexité mesurée à l'appui.
ASRock AI BOX-A395 + Qwen3.8-27B : 256K de contexte sur Strix Halo 128 GB
ASRock AI BOX-A395 (Ryzen AI Max+ 395, Radeon 8060S, 128 GB LPDDR5X-8000 partagée) fait tourner Qwen3.8-27B multimodal en local. Benchmarks mesurés llama.cpp + ROCm, KV cache, fenêtres de contexte 262k natives, OS, comparatif prix.
Qwen3.8-27B en local : 262 144 tokens de contexte sur une seule machine
Architecture hybride Gated DeltaNet, cache KV de 64 Kio par token, contexte natif 262 144 : le dimensionnement réel, carte par carte.
GLM 5.3 deep on-premise : quel matériel, à quelle vitesse ?
Étude complète GLM 5.3 de Zhipu AI : architecture MoE 744B (20B actifs), contexte 200 K, quantifications NVFP4/FP8/FP16, débit sur DGX Spark, DGX Station, H200, B200, B300, GB300 NVL72, comparatif DeepSeek V4 Flash, Kimi K3, Qwen 3.8, Claude Opus 5, GPT-5.5.
DeepSeek V4 Flash 0731 sur DGX Station et cluster 2× DGX Spark
Faire tourner le dernier modèle DeepSeek (284B, 13B actifs, 1M contexte, FP4+FP8) en local sur DGX Spark, cluster 2× Spark et DGX Station GB300 avec vLLM 0.25+. Recettes, prix, benchmarks.
Benchmark indépendant : DeepSeek V4 Flash 0731 vs Claude Opus 5 vs GPT-5.5
Benchmark 2026 : DeepSeek V4 Flash 0731 (284B, 13B actifs, 1M contexte) vs Claude Opus 5 vs GPT-5.5. MMLU-Pro, GPQA, AIME, Terminal Bench, coût par token et souveraineté.
Benchmark indépendant des modèles open weight 2026
Benchmark 2026 des modèles open weight : DeepSeek V4 Flash 0731 (284B/13B actifs, 1M contexte), GLM 5.2 (744B), Qwen 3.7 (235B), MiniMax M3 (428B), Llama 3.1 70B (70B). MMLU-Pro, GPQA, AIME, Terminal Bench, coût par token et souveraineté.
Étude de cas : DeepSeek V4 Flash 0731 sur DGX Station pour une PME
Étude de cas client : déploiement de DeepSeek V4 Flash 0731 sur DGX Station GB300 pour une PME française. Benchmarks réels, coûts, ROI 18 mois et leçons apprises.
Modèles open weight pour déploiement local 2026 : comparatif complet
Comparatif 2026 des meilleurs modèles open weight pour déploiement local : DeepSeek V4 Flash 0731, Kimi K3, GLM 5.2, Qwen 3.7, MiniMax M3, Llama 3.1 70B. Taille, contexte, licence, performance, coût et souveraineté.
Couche sémantique et ontologie pour agents IA
Le substrat qui rend les agents fiables : ontologie, knowledge graph, enforcement eBPF au noyau et déploiement serverless souverain.
Qwen3.8-Max-Preview : 2 400 milliards de paramètres, et des questions
Alibaba tease un modèle géant sans rapport technique ni benchmark indépendant. Ce que l'annonce change, et ne change pas, pour un LLM local.
Kill switch et LLM local : ce que change le rapport parlementaire n° 3054
L'accès à deux modèles d'IA majeurs suspendu sur ordre des autorités américaines, et un crédit d'impôt open source proposé pour les PME.
Prefill, decode et cache KV : quel matériel pour un LLM
Pourquoi la bande passante mémoire décide de la vitesse, et quand NVLink, SXM ou un cluster changent la donne.
Faire tourner une IA en local sur votre PC
Du PC gratuit au mini-supercalculateur DGX Spark et l'écosystème GB10 (ASUS, Dell, Lenovo, MSI, Acer).
RAG en entreprise : brancher l'IA sur vos documents
Découpage, recherche hybride, reranking et contrôle d'accès : le pipeline pour brancher un LLM sur vos documents, en local.
IA générative et RGPD : la reprise de contrôle
Ce que recommande la CNIL, le risque extraterritorial, et comment l'IA locale rend le contrôle des données à l'entreprise.
Quel serveur pour l'IA ? Guide et prix par gamme
Des fourchettes de prix par gamme, du poste au rack, dans un marché de mémoire tendu qui tire les coûts vers le haut.
LLM local : quel modèle d'IA open source choisir ?
GLM, DeepSeek, Kimi, Mistral, Qwen : comparatif 2026 des modèles à poids ouverts, par usage, matériel et licence.
Installer un LLM local en entreprise : le guide
Les cinq décisions : modèle, matériel (NVIDIA, HPE, Dell, Supermicro, Lenovo), runtime, passerelle et sécurité.
Orchestrer plusieurs agents de code en parallèle
Du poste unique à la flotte pilotée : un agent superviseur délègue aux sous-agents et la revue devient le seul vrai goulot.
Open Knowledge Format : un format ouvert pour la mémoire des agents IA
Le standard ouvert OKF représente la connaissance des agents en Markdown : portable, versionnable et interopérable, sans lock-in.
Chatbot d'entreprise : le cas d'usage du ChatGPT interne
Un ChatGPT interne branché sur vos documents par RAG, conforme au RGPD et hébergé en local : support, RH, juridique, service client.
Coder avec l'IA sur un modèle local via LiteLLM
Des assistants de code sur modèles ouverts locaux : le code reste dans l'infrastructure, le cache clé-valeur reste gratuit.
IA pour les applications métier : CRM, support, ERP, documents
Une API IA interne unique avec clés virtuelles, budgets et télémétrie par application, au lieu d'un fournisseur par outil.
Qu'est-ce qu'une plateforme IA souveraine ?
Définition, différence entre local et hybride, matériel, modèles ouverts et conformité. Le guide de référence pour cadrer un projet.
Sur site ou API : à partir de combien d'utilisateurs le LLM local est-il rentable ?
Le point de bascule des coûts LLM, le rôle du cache clé-valeur et la comparaison avec le paiement au token.
De votre serveur GPU à un service LLM en production
La méthode en sept phases, avec un livrable et un critère de sortie mesurable par phase.
D'un chatbot à une plateforme agentique
Le harness, la mémoire à trois couches et les skills qui transforment un modèle en agent utile.
Les pièges de la mise en production d'un LLM sur site
Huit erreurs qui se paient cher, et la mesure qui évite chacune. Des retours de terrain.