QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

LLM local : quel modèle d'IA open source choisir ? Comparatif 2026

GLM, DeepSeek, Kimi, Mistral, Qwen : les modèles à poids ouverts rivalisent avec les meilleures API et tournent sur votre propre matériel, et voici comment choisir selon votre usage, votre matériel et vos contraintes.

Une étagère présentant cinq cœurs de modèle abstraits de tailles et couleurs différentes, un pied à coulisse devant, et un petit serveur prêt à en recevoir un.
Réponse courte. Pour la qualité maximale, Kimi K3 et GLM 5.3 partagent la première place des modèles ouverts sur l'indice Artificial Analysis (60 chacun, version 4.1.1 consultée le 2 septembre 2026). Pour le meilleur rapport prix-performance, DeepSeek V4. Pour l'agentique et le code, Kimi K2.7. Pour la souveraineté européenne, Mistral. Pour tourner sur une seule carte, Qwen 3.6 ou Gemma 4. Tous s'installent en local via vLLM ou llama.cpp, sur des serveurs NVIDIA certifiés HPE, Dell, Supermicro ou Lenovo.

Pourquoi choisir un LLM open source en local ?

Un modèle à poids ouverts s'exécute sur votre matériel, sans envoyer vos données à un tiers, la qualité ayant rejoint celle des meilleures interfaces fermées, et le coût par token s'effondre une fois l'installation amortie, tandis que la licence permissive autorise l'usage commercial et l'hébergement souverain. Le cadre général figure dans notre définition de la plateforme IA souveraine.

Comparatif des LLM open source 2026

Les tailles indiquent le total des paramètres, mais les architectures à mélange d'experts n'en activent qu'une fraction par token, ce qui contient le coût de calcul à l'inférence.

ModèleTaillePoints fortsPour qui
GLM 5.3 et 5.2744 MdQualité maximale (GLM 5.3 à 60 sur l'indice, GLM 5.2 à 53), raisonnement, codeOrganisations exigeantes
Kimi K32800 MdNiveau frontière, contexte 1M, visionAgents à grande échelle
Kimi K2.7 Code1000 MdAgentique, appels d’outils, MCPAgents de développement
DeepSeek V41600 MdRapport prix-performance, Pro et FlashSocle polyvalent
Nemotron 3 Ultra550 MdNVFP4, contexte 1M, écosystème NVIDIAAlignés NVIDIA
MiniMax M3428 MdMultimodal, contexte long, économiqueDocuments et image
MistralPoids ouvertsSouverain FR et UE, code et raisonnementSouveraineté européenne
Qwen 3.8 et Gemma 44 à 31 MdCompact, une seule carteTPE et périphérie

Quel LLM open source selon l’usage ?

Pour le raisonnement et la génération de code, Kimi K3 et GLM 5.3 sont en tête (60 sur l'indice Artificial Analysis, contre 53 pour GLM 5.2 et 45 pour DeepSeek V4 Pro), quand Kimi K2.7 Code apporte la stabilité aux agents autonomes qui enchaînent des appels d'outils.

Pour le contexte long et les documents volumineux, Kimi K3, MiniMax M3 et Nemotron 3 Ultra offrent un million de tokens, et Kimi K3 se mesure aux API fermées puisque l'indice Artificial Analysis lui donne 60, trois points sous Claude Opus 5 (63). Ses poids sont publiés sous licence Kimi K3, mais ses 2 800 milliards de paramètres occupent de l'ordre de 1,4 To à 4 bits par paramètre : ce modèle relève de la baie, pas du poste de travail. Pour la souveraineté européenne, Mistral reste l'option de référence. Pour une TPE ou un usage en périphérie, Qwen 3.8 et Gemma 4 tiennent sur une seule carte.

Choisir selon le matériel et les partenaires

Les grands modèles à mélange d'experts demandent un serveur GPU, par exemple un serveur RTX PRO 6000 ou une baie H200. quand les modèles compacts tournent sur un poste DGX Spark ou un Mac Studio.

Le calcul repose sur les GPU NVIDIA, et les serveurs sont certifiés chez HPE, Dell, Supermicro, Lenovo, ASUS et Gigabyte, ce qui garantit le support et la garantie constructeur, QDNA intégrant ce matériel et l'exploitant pour vous du poste de travail à la baie. Le détail des paliers figure dans nos fiches matériel.

Se fournir en modèles : Hugging Face, NVFP4, Unsloth

Les poids se téléchargent sur Hugging Face, le point de distribution des modèles ouverts, où chaque éditeur publie sous son organisation officielle : zai-org pour GLM, deepseek-ai, moonshotai pour Kimi, mistralai, Qwen.

La fiche du modèle précise la licence, le format des poids, safetensors en général, et les instructions de service, tandis que l'outil huggingface-cli rapatrie les fichiers directement sur le serveur d'inférence.

Pour les GPU Blackwell, NVIDIA publie des versions déjà quantifiées au format NVFP4, un format 4 bits dont le gain se lit sur la taille des dépôts : nvidia/Qwen3.6-35B-A3B-NVFP4 pèse 23,4 Go contre 71,9 Go pour les poids BF16 d'origine, soit un facteur 3,1, alors que nvidia/DeepSeek-V4-Flash-NVFP4 pèse 168 Go contre 167 Go pour le point de contrôle officiel, déjà publié en FP8 et MXFP4 (tailles des safetensors relevées le 2 septembre 2026). Ces dépôts, comme nvidia/DeepSeek-V4-Pro-NVFP4, se servent tels quels avec vLLM ou TensorRT-LLM, sans étape de calibration à votre charge. Un serveur RTX PRO 6000 ou une baie B200 exécute ce calcul FP4 en natif.

Unsloth complète le circuit sur deux fronts : ses conversions GGUF à quantification dynamique règlent la compression couche par couche, ce qui préserve la qualité des modèles servis par llama.cpp sur un poste de travail. Le projet publie aussi ses propres versions NVFP4, comme unsloth/Qwen3.6-27B-NVFP4, 23,4 Go de poids contre 55,6 Go en BF16, ce qui ne laisse sur une carte de 24 Go que la place d'un contexte court. La même bibliothèque assure l'ajustement fin QLoRA sur une seule carte : le modèle se spécialise sur vos données sans les faire sortir de vos murs. Le détail figure dans notre fiche Unsloth.

Schéma du circuit d'un modèle ouvert : téléchargement des poids safetensors depuis les organisations officielles du hub Hugging Face, choix d'un format quantifié, NVFP4 4 bits pour serveur Blackwell ou GGUF Unsloth à compression par couche pour poste de travail, puis service par vLLM et TensorRT-LLM ou par llama.cpp et OllamaSchéma du circuit d'un modèle ouvert : téléchargement des poids safetensors depuis les organisations officielles du hub Hugging Face, choix d'un format quantifié, NVFP4 4 bits pour serveur Blackwell ou GGUF Unsloth à compression par couche pour poste de travail, puis service par vLLM et TensorRT-LLM ou par llama.cpp et Ollama
Le circuit d'un modèle ouvert : du hub Hugging Face au serveur, en NVFP4 pour les GPU Blackwell ou en GGUF Unsloth pour un poste.

Licence et souveraineté

Poids ouverts ne signifie pas toujours open source au sens strict. Vérifiez la licence, souvent MIT, Apache ou permissive, avant un usage commercial, sachant que l'exécution en local garantit que les données ne quittent pas l'entreprise, ce qui facilite la conformité au RGPD et l'hébergement de données de santé HDS.

Comment LiteLLM rend les modèles interchangeables via une passerelle ?

Ces modèles s'unifient derrière une seule interface avec LiteLLM. Changer de modèle tient en une ligne de configuration, sans réécrire le code applicatif. La suite pratique se trouve dans notre guide pour installer un LLM local en entreprise.

Questions fréquentes

Quel est le meilleur LLM open source en 2026 ?

Kimi K3 et GLM 5.3 partagent la première place des modèles ouverts sur l'indice Artificial Analysis (60, version 4.1.1 consultée le 2 septembre 2026), trois points sous Claude Opus 5 ; les poids de Kimi K3 sont publiés sur Hugging Face depuis le 16 juillet 2026. Pour un meilleur rapport coût-performance, DeepSeek V4 offre un niveau frontière à coût réduit.

Un modèle d'IA open source peut-il tourner en local ?

Oui. Servi par vLLM sur serveur GPU ou par llama.cpp quantifié sur un poste, un modèle à poids ouverts s'exécute entièrement sur votre infrastructure, sans dépendance externe.

Quel modèle open source pour coder en local ?

Kimi K2.7 Code pour la stabilité agentique et les appels d'outils, GLM 5.3 ou DeepSeek V4 pour la qualité de génération. Codestral de Mistral est l'option souveraine européenne.

Sur quel matériel faire tourner un LLM open source ?

Un poste DGX Spark ou Mac Studio pour les modèles compacts, un serveur RTX PRO 6000 ou une baie H200 pour les grands modèles. Les serveurs sont certifiés chez HPE, Dell, Supermicro et Lenovo sur base GPU NVIDIA.

Où télécharger un LLM open source ?

Sur Hugging Face, depuis l'organisation officielle de l'éditeur. Les versions NVFP4 publiées par NVIDIA et les GGUF d'Unsloth y sont prêtes à servir : la première pour un serveur Blackwell sous vLLM, la seconde pour un poste sous llama.cpp.

Un LLM open source vaut-il une API fermée comme ChatGPT ?

Sur la qualité, les meilleurs modèles ouverts rejoignent les API fermées en raisonnement et en code. La différence tient au contrôle : en local, les données restent chez vous et le coût par token s'effondre une fois le matériel amorti, là où une API facture chaque appel et traite vos données à l'extérieur. Le calcul détaillé figure dans notre comparaison sur site ou API.

Choisissez le bon modèle pour votre plateforme

Un échange pour cadrer le modèle, le matériel et le runtime selon votre usage réel.

Réserver un échange

Références