Plan du site Toutes les rubriques de qdna.fr, des fiches matériel aux articles du blog. MatérielDGX SparkMac Studio UltraDGX StationServeur RTX PRO 6000Serveur H200 SXMB200 SXMB300 SXMGB300 NVL72 Modèles ouvertsGLM 5.3Kimi K3Kimi K2.7 CodeDeepSeek V4Nemotron 3 UltraMiniMax M3MistralQwen 3.8 et Gemma 4 Runtime d’inférencevLLMTriton Inference ServerDynamollama.cppUnslothninfer Orchestration multi-agentsHermes AgentOpenCodeHarness d’agentLiteLLMRouteur sémantiqueServeurs MCP privésMémoire à trois couches API externesOpenAI (ChatGPT)Anthropic (Claude)Amazon BedrockOpenRouterAzure AI Foundry BlogTutoriel : Piloter un jumeau d'organisation numérique (Digital Organisational Twins)Moteur d'inférence LLM : comparatif vLLM, SGLang, TensorRT-LLM, llama.cpp et Dynamo en 2026Inférence souveraine : 8 × RTX PRO 6000 Blackwell face à 8 × H200 SXMFull Stack AI Company : bâtir sa plateforme avec l'IA on-premise, Hugging Face et NVIDIAEntraînement d'un modèle local et RFT : le pipeline complet de QLoRA à la productionIA conforme au RGPD : la liste de contrôle pour une IA générative en entreprisePlateforme IA locale et LLM open source : l'analyse d'un choix on-premiseDébit d'un LLM en tokens par seconde : les quatre conditions qui changent tout, mesurées sur seize machinesQwen3.8-Flash-Next sur Mac Studio M5 Ultra : 112 Go de poids, un million de tokensGLM-5.3-Flash sur Mac Studio M5 Ultra : 320 milliards de paramètres dans 512 GoPatterns RAG avancés en entreprise : ce qui sépare une démo d'un système qui tientDonnées sensibles et IA : ce qu'une politique de zéro rétention garantit vraimentTraduction juridique et IA : traduire un contrat sans le publierChatbot IA et RGPD : les quatre obligations qui se règlent dans l'architectureMoteur d'orchestration IA : router chaque requête vers le bon modèleMac Studio M5 Ultra : 512 Go à 1,2 To/s, ce que ça change pour un LLM localASRock AI BOX-A395 + Qwen3.8-27B : 256K de contexte sur Strix Halo 128 GBQwen3.8-27B en local : 262 144 tokens de contexte sur une seule machineDeepSeek V4 Flash Vision Exp : premier multimodal ouvertGLM 5.3 deep on-premise : quel matériel, à quelle vitesse ?DeepSeek V4 Flash 0731 sur DGX Station et cluster 2× DGX SparkBenchmark indépendant : DeepSeek V4 Flash 0731 vs Claude Opus 5 vs GPT-5.5Résultats publiés de DeepSeek V4 Flash 0731 (open weight, 2026)Scénario chiffré : DeepSeek V4 sur DGX Station pour une PME de 80 personnesModèles open weight pour déploiement local 2026 : comparatif completCouche sémantique et ontologie pour agents IAQwen3.8-Max-Preview : 2 400 milliards de paramètres, et des questionsKill switch et LLM local : ce que change le rapport parlementaire n° 3054Prefill, decode et cache KV : quel matériel pour un LLMFaire tourner une IA en local sur votre PCRAG en entreprise : brancher l'IA sur vos documentsIA générative et RGPD : la reprise de contrôleQuel serveur pour l'IA ? Guide et prix par gammeLLM local : quel modèle d'IA open source choisir ?Installer un LLM local en entreprise : le guideOrchestrer plusieurs agents de code en parallèleOpen Knowledge Format : un format ouvert pour la mémoire des agents IAChatbot d'entreprise : le cas d'usage du ChatGPT interneCoder avec l'IA sur un modèle local via LiteLLMIA pour les applications métier : CRM, support, ERP, documentsQu'est-ce qu'une plateforme IA souveraine ?Sur site ou API : à partir de combien d'utilisateurs le LLM local est-il rentable ?De votre serveur GPU à un service LLM en productionD'un chatbot à une plateforme agentiqueLes pièges de la mise en production d'un LLM sur site SecteursSantéFinanceJuridiqueIndustrieSecteur public OutilsCalculateur de mémoireComparateur de coût API ou local Réalisationsgironde.qdna.frmmr.qdna.frapprendre-ia.qdna.frCluster DGX Spark RDMAmedia.qdna.fr, vidéo HLS ↗ (site externe) Le siteAccueilÀ proposContactMentions légalesPolitique de confidentialitéAccessibilité : non conformeSite map (English)