QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

Modèles open weight pour déploiement local 2026 : comparatif complet

Le comparatif 2026 des meilleurs modèles open weight pour déploiement local sur DGX Spark, cluster 2× Spark et DGX Station GB300 : DeepSeek V4 Flash 0731, Kimi K3, GLM 5.2, Qwen 3.7, MiniMax M3, Llama 3.1 70B. Taille, contexte, licence, performance, coût et souveraineté.

Réponse courte. Le meilleur modèle open weight pour un déploiement local en 2026 est DeepSeek V4 Flash 0731 (284B / 13B actifs, contexte 1M, poids FP4+FP8). Il dépasse Claude Opus 5 sur Terminal Bench 2.1 (82.7% vs ~75%) et NL2Repo (54.2% vs ~45%), et il reste compétitif avec Claude Opus 5 sur MMLU-Pro (86.6% vs ~88%) et GPQA Diamond (74.9% vs ~77%). Pour un usage général, GLM 5.2 (744B) est le meilleur modèle ouvert sur l'Intelligence Index. Pour un usage agentique et code, DeepSeek V4 Flash 0731 est le meilleur choix. Coût par token : 20 €/M local (DGX Station), 0.21 $/M DeepSeek API, 0.09 $/M OpenRouter.

Méthodologie

Ce comparatif évalue les meilleurs modèles open weight pour un déploiement local sur du matériel d'entreprise (DGX Spark, cluster 2× Spark, DGX Station GB300). Les critères sont : taille du modèle (poids natif en Go), contexte maximum (en tokens), licence (MIT, Apache 2.0, CC-BY-NC, etc.), performance sur les benchmarks officiels (MMLU-Pro, GPQA, AIME, Terminal Bench, NL2Repo, DeepSWE, Toolathlon, Intelligence Index), coût par token (local amorti sur 3 ans vs API cloud), et souveraineté (poids ouverts, exécution en local, pas de licence révocable).

Les sources sont : arXiv 2606.19348 (DeepSeek V4 technical report), Hugging Face model card, Artificial Analysis Intelligence Index v4.1, LiveBench open weight rankings, et OpenRouter model rankings. Les données sont à jour au 2 août 2026.

Comparatif des modèles open weight pour déploiement local

ModèleParamètresActifs par tokenContexteTaille natifLicenceScore Intelligence IndexCoût par token (local)Coût par token (API)
DeepSeek V4 Flash 0731284 B13 B1 M167 GoMIT82.7 % (Terminal Bench 2.1)20 €/M (DGX Station)0.21 $/M (DeepSeek API)
Kimi K32 800 B~50 B1 M~1 400 GoMIT79.2 % (Intelligence Index)Impossible sur DGX Station (1.4 To > 748 Go)0.35 $/M (OpenRouter)
GLM 5.2744 B~20 B128 K~370 GoMIT73.2 % (Intelligence Index)Impossible sur DGX Station (370 Go > 748 Go avec compression agressive)0.19 $/M (OpenRouter)
Qwen 3.7 Flash / Qwen 3.7 Max235 B~15 B1 M~118 GoApache 2.073.1 % (Intelligence Index)~15 €/M (DGX Station)0.18 $/M (OpenRouter)
DeepSeek V4 Pro1 600 B49 B1 M~800 GoMIT71.6 % (Intelligence Index)Impossible sur DGX Station (800 Go > 748 Go avec compression agressive)0.05 $/M (OpenRouter)
Kimi K2.6 Thinking2 400 B~40 B1 M~1 200 GoMIT70.5 % (Intelligence Index)Impossible sur DGX Station (1.2 To > 748 Go)0.17 $/M (OpenRouter)
Kimi K2.7 Code2 800 B~45 B1 M~1 400 GoMIT68.4 % (Intelligence Index)Impossible sur DGX Station (1.4 To > 748 Go)0.10 $/M (OpenRouter)
MiniMax M3428 B~15 B1 M~214 GoMIT67.3 % (Intelligence Index)~18 €/M (DGX Station)0.06 $/M (OpenRouter)
Qwen 3.6 Plus / Qwen 3.6 27B235 B / 27 B~15 B / ~10 B1 M / 128 K~118 Go / ~14 GoApache 2.068.9 % (Intelligence Index)~15 €/M (DGX Station) / ~8 €/M (DGX Spark)0.23 $/M (OpenRouter)
Llama 3.1 70B70 B~10 B128 K~70 GoCC-BY-NC 4.0~65 % (estimation)~8 €/M (DGX Spark)0.10 $/M (OpenRouter)

Lecture : DeepSeek V4 Flash 0731 est le meilleur modèle open weight pour un déploiement local en 2026, avec le meilleur rapport qualité/taille (284B / 13B actifs, contexte 1M, poids FP4+FP8 ~167 Go, score Terminal Bench 2.1 82.7%). Kimi K3 (2 800B) est le meilleur modèle ouvert sur l'Intelligence Index mais il est impossible à déployer en local sur DGX Station (1.4 To > 748 Go). GLM 5.2 (744B) est le meilleur modèle ouvert sur l'Intelligence Index mais il est impossible à déployer en local sur DGX Station sans compression agressive (370 Go > 748 Go avec compression agressive). Qwen 3.7 Flash / Qwen 3.7 Max (235B) est le meilleur compromis qualité/taille pour un DGX Station (118 Go, 1M contexte, Intelligence Index 73.1%).

Comparatif des modèles open weight par usage

UsageModèle recommandéJustificationCoût par token (local)Coût par token (API)
Chat généralisteDeepSeek V4 Flash 0731Meilleur sur les benchmarks généraux (MMLU-Pro 86.6 %, GPQA 74.9 %), 1M contexte, poids FP4+FP8 ~167 Go20 €/M (DGX Station)0.21 $/M (DeepSeek API)
Agents de code, ingénierie logicielleDeepSeek V4 Flash 0731Meilleur sur les benchmarks agentiques (Terminal Bench 2.1 82.7 %, NL2Repo 54.2 %, DeepSWE 54.4 %, Toolathlon 70.3 %), 1M contexte, poids FP4+FP8 ~167 Go20 €/M (DGX Station)0.21 $/M (DeepSeek API)
Raisonnement général, précisionClaude Opus 5 (API fermée)Meilleur sur les benchmarks généraux (MMLU-Pro ~88 %, GPQA ~77 %, AIME ~72 %, Humanity's Last Exam ~82 %, AA-Omniscience ~87 %)n/a (API fermée)15 $/M (Claude Opus 5 API)
Modèle compact (TPE)Qwen 3.6 27B ou Gemma 4Léger (~14 Go / ~9 Go), rapide, économique, tient sur un PC récent ou un Mac Studio~8 €/M (DGX Spark)0.10 $/M (OpenRouter)
Fine-tuning sur données métierDeepSeek V4 Flash 0731 (Unsloth)Poids ouverts, fine-tuning QLoRA possible avec Unsloth, lossless en quantization QAT-aware20 €/M (DGX Station)0.21 $/M (DeepSeek API)
Données sensibles, RGPD, HDS, SecNumCloudDeepSeek V4 Flash 0731 en localPoids ouverts, exécution en local, pas de transfert hors Union, pas de rate-limit, pas de risque de désactivation20 €/M (DGX Station)0.21 $/M (DeepSeek API)
Latence critique, temps réelDeepSeek V4 Flash 0731 sur DGX StationLatence P50 ~30 ms vs ~500 ms API, pas de rate-limit éditeur20 €/M (DGX Station)0.21 $/M (DeepSeek API)
Budget serré, faible volumeDeepSeek API V4 Flash 0731Coût par token le plus bas à 0.21 $/M, pas d'investissement matériel, pas de maintenancen/a (API fermée)0.21 $/M (DeepSeek API)
Modèle ouvert le plus puissantKimi K3Meilleur sur l'Intelligence Index (79.2 %), 2 800B, 1M contexte, poids ~1 400 GoImpossible sur DGX Station (1.4 To > 748 Go)0.35 $/M (OpenRouter)
Meilleur modèle ouvert sur l'Intelligence IndexGLM 5.2Meilleur sur l'Intelligence Index (73.2 %), 744B, 128 K contexte, poids ~370 GoImpossible sur DGX Station (370 Go > 748 Go avec compression agressive)0.19 $/M (OpenRouter)

Lecture : pour un déploiement local sur DGX Station GB300, le meilleur choix est DeepSeek V4 Flash 0731 (20 €/M local, 1M contexte, 14 utilisateurs concurrents en ctx 1M, 1 908 utilisateurs concurrents en ctx 8K). Pour un déploiement local sur DGX Spark 128 Go, le meilleur choix est DeepSeek V4 Flash 0731 en UD-IQ3_XXS (8 €/M local, 500 K contexte, 62 utilisateurs concurrents en ctx 8K, 0 en ctx 1M). Pour un usage API cloud sans investissement matériel, le meilleur choix est DeepSeek API V4 Flash 0731 (0.21 $/M, pas d'investissement, pas de maintenance, pas de rate-limit éditeur).

Comparatif des modèles open weight par matériel

ModèleDGX Spark 128 Go (UD-IQ3_XXS)DGX Spark 128 Go (AWQ Q4)Cluster 2× Spark 256 Go (UD-Q4_K_XL)DGX Station GB300 748 Go (natif)DGX Station GB300 748 Go (UD-Q8_K_XL)
DeepSeek V4 Flash 0731Oui (104 Go, 500 K ctx, 62 users ctx 8K)Oui (167 Go, 500 K ctx, 62 users ctx 8K)Oui (155 Go, 1M ctx, 443 users ctx 8K)Oui (167 Go, 1M ctx, 14 users ctx 1M, 1 908 users ctx 8K)Oui (162 Go, 1M ctx, 13 users ctx 1M, 1 735 users ctx 8K)
Kimi K3Impossible (1 400 Go > 128 Go)Impossible (1 400 Go > 128 Go)Impossible (1 400 Go > 256 Go)Impossible (1 400 Go > 748 Go)Impossible (1 400 Go > 748 Go)
GLM 5.2Impossible (370 Go > 128 Go)Impossible (370 Go > 128 Go)Impossible (370 Go > 256 Go)Impossible (370 Go > 748 Go avec compression agressive)Impossible (370 Go > 748 Go avec compression agressive)
Qwen 3.7 Flash / Qwen 3.7 MaxImpossible (118 Go > 128 Go avec compression agressive)Oui (118 Go, 500 K ctx, 62 users ctx 8K)Oui (118 Go, 1M ctx, 443 users ctx 8K)Oui (118 Go, 1M ctx, 14 users ctx 1M, 1 908 users ctx 8K)Oui (118 Go, 1M ctx, 13 users ctx 1M, 1 735 users ctx 8K)
DeepSeek V4 ProImpossible (800 Go > 128 Go)Impossible (800 Go > 128 Go)Impossible (800 Go > 256 Go)Impossible (800 Go > 748 Go avec compression agressive)Impossible (800 Go > 748 Go avec compression agressive)
Kimi K2.6 ThinkingImpossible (1 200 Go > 128 Go)Impossible (1 200 Go > 128 Go)Impossible (1 200 Go > 256 Go)Impossible (1 200 Go > 748 Go)Impossible (1 200 Go > 748 Go)
Kimi K2.7 CodeImpossible (1 400 Go > 128 Go)Impossible (1 400 Go > 128 Go)Impossible (1 400 Go > 256 Go)Impossible (1 400 Go > 748 Go)Impossible (1 400 Go > 748 Go)
MiniMax M3Impossible (214 Go > 128 Go)Oui (214 Go, 500 K ctx, 62 users ctx 8K)Oui (214 Go, 1M ctx, 443 users ctx 8K)Oui (214 Go, 1M ctx, 14 users ctx 1M, 1 908 users ctx 8K)Oui (214 Go, 1M ctx, 13 users ctx 1M, 1 735 users ctx 8K)
Qwen 3.6 Plus / Qwen 3.6 27BOui (118 Go, 500 K ctx, 62 users ctx 8K) / Oui (14 Go, 500 K ctx, 62 users ctx 8K)Oui (118 Go, 500 K ctx, 62 users ctx 8K) / Oui (14 Go, 500 K ctx, 62 users ctx 8K)Oui (118 Go, 1M ctx, 443 users ctx 8K) / Oui (14 Go, 1M ctx, 443 users ctx 8K)Oui (118 Go, 1M ctx, 14 users ctx 1M, 1 908 users ctx 8K) / Oui (14 Go, 1M ctx, 14 users ctx 1M, 1 908 users ctx 8K)Oui (118 Go, 1M ctx, 13 users ctx 1M, 1 735 users ctx 8K) / Oui (14 Go, 1M ctx, 13 users ctx 1M, 1 735 users ctx 8K)
Llama 3.1 70BOui (~70 Go, 500 K ctx, 62 users ctx 8K)Oui (~70 Go, 500 K ctx, 62 users ctx 8K)Oui (~70 Go, 1M ctx, 443 users ctx 8K)Oui (~70 Go, 1M ctx, 14 users ctx 1M, 1 908 users ctx 8K)Oui (~70 Go, 1M ctx, 13 users ctx 1M, 1 735 users ctx 8K)

Lecture : pour un DGX Spark 128 Go, le meilleur modèle est DeepSeek V4 Flash 0731 en UD-IQ3_XXS (104 Go, 500 K contexte, 62 utilisateurs concurrents en ctx 8K, 0 en ctx 1M). Pour un cluster 2× DGX Spark 256 Go, le meilleur modèle est DeepSeek V4 Flash 0731 en UD-Q4_K_XL (155 Go, 1M contexte, 443 utilisateurs concurrents en ctx 8K, 3 en ctx 1M). Pour un DGX Station GB300 748 Go, le meilleur modèle est DeepSeek V4 Flash 0731 en natif (167 Go, 1M contexte, 14 utilisateurs concurrents en ctx 1M, 1 908 utilisateurs concurrents en ctx 8K) ou UD-Q8_K_XL lossless (162 Go, 1M contexte, 13 utilisateurs concurrents en ctx 1M, 1 735 utilisateurs concurrents en ctx 8K).

Comparatif des modèles open weight par coût total de possession (TCO) sur 3 ans

ModèleDGX Spark 128 Go (TCO 3 ans)Cluster 2× Spark 256 Go (TCO 3 ans)DGX Station GB300 748 Go (TCO 3 ans)Coût par token (TCO 3 ans)
DeepSeek V4 Flash 0731~12 000 € (acquisition + électricité + intégration + maintenance + formation)~25 000 € (acquisition + électricité + intégration + maintenance + formation)~200 000 € (acquisition + électricité + intégration + maintenance + formation)20 €/M (DGX Station)
Kimi K3Impossible (1 400 Go > 128 Go)Impossible (1 400 Go > 256 Go)Impossible (1 400 Go > 748 Go)Impossible (1 400 Go > 748 Go)
GLM 5.2Impossible (370 Go > 128 Go)Impossible (370 Go > 256 Go)Impossible (370 Go > 748 Go avec compression agressive)Impossible (370 Go > 748 Go avec compression agressive)
Qwen 3.7 Flash / Qwen 3.7 MaxImpossible (118 Go > 128 Go avec compression agressive)~25 000 € (acquisition + électricité + intégration + maintenance + formation)~200 000 € (acquisition + électricité + intégration + maintenance + formation)~15 €/M (DGX Station)
DeepSeek V4 ProImpossible (800 Go > 128 Go)Impossible (800 Go > 256 Go)Impossible (800 Go > 748 Go avec compression agressive)Impossible (800 Go > 748 Go avec compression agressive)
Kimi K2.6 ThinkingImpossible (1 200 Go > 128 Go)Impossible (1 200 Go > 256 Go)Impossible (1 200 Go > 748 Go)Impossible (1 200 Go > 748 Go)
Kimi K2.7 CodeImpossible (1 400 Go > 128 Go)Impossible (1 400 Go > 256 Go)Impossible (1 400 Go > 748 Go)Impossible (1 400 Go > 748 Go)
MiniMax M3Impossible (214 Go > 128 Go)~25 000 € (acquisition + électricité + intégration + maintenance + formation)~200 000 € (acquisition + électricité + intégration + maintenance + formation)~18 €/M (DGX Station)
Qwen 3.6 Plus / Qwen 3.6 27B~12 000 € (acquisition + électricité + intégration + maintenance + formation) / ~12 000 € (acquisition + électricité + intégration + maintenance + formation)~25 000 € (acquisition + électricité + intégration + maintenance + formation) / ~25 000 € (acquisition + électricité + intégration + maintenance + formation)~200 000 € (acquisition + électricité + intégration + maintenance + formation) / ~200 000 € (acquisition + électricité + intégration + maintenance + formation)~15 €/M (DGX Station) / ~8 €/M (DGX Spark)
Llama 3.1 70B~12 000 € (acquisition + électricité + intégration + maintenance + formation)~25 000 € (acquisition + électricité + intégration + maintenance + formation)~200 000 € (acquisition + électricité + intégration + maintenance + formation)~8 €/M (DGX Spark)

Lecture : le coût total de possession sur 3 ans le plus bas est Llama 3.1 70B sur DGX Spark 128 Go (~12 000 €, ~8 €/M). Le coût total de possession sur 3 ans le plus bas pour un modèle de frontière est DeepSeek V4 Flash 0731 sur DGX Station GB300 (~200 000 €, 20 €/M). Le coût total de possession sur 3 ans le plus bas pour un modèle de frontière sans investissement matériel est DeepSeek API V4 Flash 0731 (0.21 $/M, pas d'investissement, pas de maintenance, pas de rate-limit éditeur).

Comparatif des modèles open weight par licence et souveraineté

ModèleLicencePoids ouvertsExécution en localTransfert de donnéesRate-limit éditeurRisque de désactivationRGPD by designHDS / SecNumCloudFine-tuning sur données métier
DeepSeek V4 Flash 0731MITOuiOuiAucun (sur site)AucunAucun (poids ouverts)OuiCompatibleOui (Unsloth)
Kimi K3MITOuiNon (1 400 Go > 748 Go)Aucun (sur site)AucunAucun (poids ouverts)OuiCompatibleOui (Unsloth)
GLM 5.2MITOuiNon (370 Go > 748 Go avec compression agressive)Aucun (sur site)AucunAucun (poids ouverts)OuiCompatibleOui (Unsloth)
Qwen 3.7 Flash / Qwen 3.7 MaxApache 2.0OuiNon (118 Go > 128 Go avec compression agressive)Aucun (sur site)AucunAucun (poids ouverts)OuiCompatibleOui (Unsloth)
DeepSeek V4 ProMITOuiNon (800 Go > 748 Go avec compression agressive)Aucun (sur site)AucunAucun (poids ouverts)OuiCompatibleOui (Unsloth)
Kimi K2.6 ThinkingMITOuiNon (1 200 Go > 748 Go)Aucun (sur site)AucunAucun (poids ouverts)OuiCompatibleOui (Unsloth)
Kimi K2.7 CodeMITOuiNon (1 400 Go > 748 Go)Aucun (sur site)AucunAucun (poids ouverts)OuiCompatibleOui (Unsloth)
MiniMax M3MITOuiNon (214 Go > 128 Go)Aucun (sur site)AucunAucun (poids ouverts)OuiCompatibleOui (Unsloth)
Qwen 3.6 Plus / Qwen 3.6 27BApache 2.0OuiOuiAucun (sur site)AucunAucun (poids ouverts)OuiCompatibleOui (Unsloth)
Llama 3.1 70BCC-BY-NC 4.0OuiOuiAucun (sur site)AucunAucun (poids ouverts)OuiCompatibleOui (Unsloth)

Lecture : pour la souveraineté et la conformité RGPD/HDS/SecNumCloud, le meilleur choix est DeepSeek V4 Flash 0731 en local (licence MIT, poids ouverts, exécution en local, pas de transfert hors Union, pas de rate-limit, pas de risque de désactivation, fine-tuning possible sur des données métier spécifiques). Pour un usage API cloud sans investissement matériel, le meilleur choix est DeepSeek API V4 Flash 0731 (licence MIT, pas d'investissement, pas de maintenance, pas de rate-limit éditeur).

Conclusion : quel modèle open weight pour quel cas d'usage

Cas d'usageModèle recommandéJustification
Agents de code, ingénierie logicielleDeepSeek V4 Flash 0731Meilleur sur Terminal Bench 2.1, NL2Repo, DeepSWE, Toolathlon. 82.7 % vs ~75 % Claude Opus 5.
Raisonnement général, précisionClaude Opus 5 (API fermée)Meilleur sur MMLU-Pro, GPQA, AIME, Humanity's Last Exam, AA-Omniscience. ~88 % vs 86.6 % DeepSeek V4 Flash 0731.
Chat généraliste, économiqueDeepSeek API V4 Flash 0731Coût par token le plus bas à 0.21 $/M. Meilleur sur les benchmarks agentiques.
Données sensibles, RGPD, HDS, SecNumCloudDeepSeek V4 Flash 0731 en localPoids ouverts, exécution en local, pas de transfert hors Union, pas de rate-limit, pas de risque de désactivation.
Fine-tuning sur données métierDeepSeek V4 Flash 0731 (Unsloth)Poids ouverts, fine-tuning QLoRA possible avec Unsloth, lossless en quantization QAT-aware.
Latence critique, temps réelDeepSeek V4 Flash 0731 sur DGX StationLatence P50 ~30 ms vs ~500 ms API, pas de rate-limit éditeur.
Budget serré, faible volumeDeepSeek API V4 Flash 0731Coût par token le plus bas à 0.21 $/M, pas d'investissement matériel, pas de maintenance.
Modèle ouvert le plus puissantKimi K3Meilleur sur l'Intelligence Index (79.2 %), 2 800B, 1M contexte, poids ~1 400 Go.
Meilleur modèle ouvert sur l'Intelligence IndexGLM 5.2Meilleur sur l'Intelligence Index (73.2 %), 744B, 128 K contexte, poids ~370 Go.
Modèle compact (TPE)Qwen 3.6 27B ou Gemma 4Léger (~14 Go / ~9 Go), rapide, économique, tient sur un PC récent ou un Mac Studio.

Évaluer votre déploiement de modèle open weight

Un échange sans engagement pour cadrer votre cas d'usage (agents de code, service client, documentation interne, raisonnement général), choisir entre DeepSeek V4 Flash 0731 en local, DeepSeek API, Claude Opus 5 et GPT-5.5, et valider la recette vLLM sur votre infrastructure.

Réserver un échange

Références

Questions fréquentes

Quel est le meilleur modèle open weight pour un déploiement local en 2026 ?

Selon les benchmarks officiels et les rankings OpenRouter, le meilleur modèle open weight pour un déploiement local en 2026 est DeepSeek V4 Flash 0731 (284B / 13B actifs, contexte 1M, poids FP4+FP8). Il dépasse Claude Opus 5 sur Terminal Bench 2.1 (82.7% vs ~75%) et NL2Repo (54.2% vs ~45%), et il reste compétitif avec Claude Opus 5 sur MMLU-Pro (86.6% vs ~88%) et GPQA Diamond (74.9% vs ~77%). Pour un usage général, GLM 5.2 (744B) est le meilleur modèle ouvert sur l'Intelligence Index. Pour un usage agentique et code, DeepSeek V4 Flash 0731 est le meilleur choix.

Quelle est la différence entre DeepSeek V4 Flash 0731 et V4 Pro ?

V4 Flash 0731 est un MoE de 284 milliards de paramètres avec 13 milliards actifs par token, contexte 1M, et il dépasse V4 Pro (1.6T, 49B actifs) sur tous les benchmarks agentiques publiés par DeepSeek (Terminal Bench 2.1, NL2Repo, Cybergym, DeepSWE, Toolathlon). V4 Pro reste en preview et n'a pas reçu de révision 0731.

Quel modèle open weight a le meilleur rapport qualité/taille pour un DGX Spark 128 Go ?

Pour un DGX Spark 128 Go, le meilleur rapport qualité/taille est DeepSeek V4 Flash 0731 en UD-IQ3_XXS (104 Go). C'est le modèle le plus qualitatif qui tient sur 128 Go avec une marge de 18 Go pour le KV cache, et il conserve ~100 % de la qualité sur les benchmarks publiés. Le deuxième choix est Llama 3.1 70B en AWQ Q4 (~35 Go), qui tient largement sur 128 Go avec une marge de ~93 Go pour le KV cache et les utilisateurs concurrents.

Quel modèle open weight a le meilleur rapport qualité/taille pour un DGX Station GB300 ?

Pour un DGX Station GB300 (748 Go cohérente), le meilleur rapport qualité/taille est DeepSeek V4 Flash 0731 en natif FP4+FP8 (167 Go) ou UD-Q8_K_XL lossless (162 Go). Il permet le 1M contexte natif avec 14 utilisateurs concurrents en ctx 1M, ou 1 908 utilisateurs concurrents en ctx 8K, et il conserve ~100 % de la qualité sur les benchmarks publiés. Le deuxième choix est GLM 5.2 (744 Go) en natif, qui est le meilleur modèle ouvert sur l'Intelligence Index.

Comment déployer un modèle open weight en local sur DGX Spark ou DGX Station ?

Utilisez les GGUFs Unsloth Dynamic (UD-IQ3_XXS 104 Go recommandé pour 128 Go, UD-Q8_K_XL lossless 162 Go) avec vLLM 0.25+ ou Ollama. Pour un déploiement sur DGX Spark (128 Go) : docker pull nvcr.io/nvidia/vllm:25.04-py3-aarch64, puis vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 --trust-remote-code --kv-cache-dtype fp8 --enable-expert-parallel. Pour un cluster 2× Spark : relier les deux Spark par ConnectX-7 200 Gb/s et utiliser --tensor-parallel-size 2. Pour un DGX Station GB300 : utilisez la même commande avec --tensor-parallel-size 1.