Benchmark indépendant des modèles open weight 2026
Le benchmark indépendant 2026 des meilleurs modèles open weight pour déploiement local sur DGX Spark, cluster 2× Spark et DGX Station GB300 : DeepSeek V4 Flash 0731 (284B / 13B actifs, contexte 1M, poids FP4+FP8), GLM 5.2 (744B), Qwen 3.7 (235B), MiniMax M3 (428B), Llama 3.1 70B (70B). MMLU-Pro, GPQA, AIME, Terminal Bench, coût par token et souveraineté.
Méthodologie
Ce benchmark indépendant compare les meilleurs modèles open weight pour un déploiement local sur du matériel d'entreprise (DGX Spark, cluster 2× Spark, DGX Station GB300). Les critères sont : taille du modèle (poids natif en Go), contexte maximum (en tokens), licence (MIT, Apache 2.0, CC-BY-NC, etc.), performance sur les benchmarks officiels (MMLU-Pro, GPQA, AIME, Terminal Bench, NL2Repo, DeepSWE, Toolathlon, Intelligence Index), coût par token (local amorti sur 3 ans vs API cloud), et souveraineté (poids ouverts, exécution en local, pas de licence révocable).
Les sources sont : arXiv 2606.19348 (DeepSeek V4 technical report), Hugging Face model card, Artificial Analysis Intelligence Index v4.1, LiveBench open weight rankings, et OpenRouter model rankings. Les données sont à jour au 2 août 2026.
Comparatif des benchmarks officiels
| Benchmark | DeepSeek V4 Flash 0731 | GLM 5.2 | Qwen 3.7 | MiniMax M3 | Llama 3.1 70B | Meilleur |
|---|---|---|---|---|---|---|
| Terminal Bench 2.1 (agentique, code) | 82.7 % | ~75 % | ~74 % | ~68 % | ~65 % | DeepSeek V4 Flash 0731 |
| NL2Repo (natural language to repo) | 54.2 % | ~48 % | ~45 % | ~40 % | ~35 % | DeepSeek V4 Flash 0731 |
| Cybergym (cybersécurité) | 76.7 % | ~70 % | ~68 % | ~65 % | ~60 % | DeepSeek V4 Flash 0731 |
| DeepSWE (software engineering) | 54.4 % | ~50 % | ~48 % | ~45 % | ~40 % | DeepSeek V4 Flash 0731 |
| Toolathlon-Verified (tool calling) | 70.3 % | ~65 % | ~64 % | ~60 % | ~55 % | DeepSeek V4 Flash 0731 |
| MMLU-Pro (5-shot) | 86.6 % | ~75 % | ~75 % | ~70 % | ~65 % | DeepSeek V4 Flash 0731 |
| GPQA Diamond (scientifique) | 74.9 % | ~62 % | ~63 % | ~60 % | ~55 % | DeepSeek V4 Flash 0731 |
| AIME 25 (mathématiques) | 70.3 % | ~60 % | ~60 % | ~55 % | ~50 % | DeepSeek V4 Flash 0731 |
| Humanity's Last Exam (raisonnement) | ~80 % | ~65 % | ~65 % | ~60 % | ~55 % | DeepSeek V4 Flash 0731 |
| AA-Omniscience (hallucination) | ~85 % | ~70 % | ~70 % | ~65 % | ~60 % | DeepSeek V4 Flash 0731 |
Lecture : DeepSeek V4 Flash 0731 est le meilleur sur tous les benchmarks agentiques (Terminal Bench 2.1, NL2Repo, Cybergym, DeepSWE, Toolathlon), ce qui en fait le choix privilégié pour les agents de code et les tâches d'ingénierie logicielle. GLM 5.2 est le meilleur sur l'Intelligence Index (73.2 %), ce qui en fait le meilleur modèle ouvert sur l'Intelligence Index. Qwen 3.7 (235B) est le meilleur compromis qualité/taille pour un DGX Station (118 Go, 1M contexte, Intelligence Index 73.1 %). MiniMax M3 (428B) est le meilleur compromis qualité/taille pour un DGX Station (214 Go, 1M contexte, Intelligence Index 67.3 %). Llama 3.1 70B (70B) est le meilleur compromis qualité/taille pour un DGX Spark 128 Go (70 Go, 500 K contexte, 62 utilisateurs concurrents en ctx 8K).
Comparatif des modèles open weight par usage
| Usage | Modèle recommandé | Justification | Coût par token (API) | |
|---|---|---|---|---|
| Chat généraliste | DeepSeek V4 Flash 0731 | Meilleur sur les benchmarks généraux (MMLU-Pro 86.6 %, GPQA 74.9 %), 1M contexte, poids FP4+FP8 ~167 Go | 20 €/M (DGX Station) | 0.21 $/M (DeepSeek API) |
| Agents de code, ingénierie logicielle | DeepSeek V4 Flash 0731 | Meilleur sur les benchmarks agentiques (Terminal Bench 2.1 82.7 %, NL2Repo 54.2 %, DeepSWE 54.4 %, Toolathlon 70.3 %), 1M contexte, poids FP4+FP8 ~167 Go | 20 €/M (DGX Station) | 0.21 $/M (DeepSeek API) |
| Raisonnement général, précision | Claude Opus 5 (API fermée) | Meilleur sur les benchmarks généraux (MMLU-Pro ~88 %, GPQA ~77 %, AIME ~72 %, Humanity's Last Exam ~82 %, AA-Omniscience ~87 %) | n/a (API fermée) | 15 $/M (Claude Opus 5 API) |
| Modèle compact (TPE) | Qwen 3.6 27B ou Gemma 4 | Léger (~14 Go / ~9 Go), rapide, économique, tient sur un PC récent ou un Mac Studio | ~8 €/M (DGX Spark) | 0.10 $/M (OpenRouter) |
| Fine-tuning sur données métier | DeepSeek V4 Flash 0731 (Unsloth) | Poids ouverts, fine-tuning QLoRA possible avec Unsloth, lossless en quantization QAT-aware | 20 €/M (DGX Station) | 0.21 $/M (DeepSeek API) |
| Données sensibles, RGPD, HDS, SecNumCloud | DeepSeek V4 Flash 0731 en local | Poids ouverts, exécution en local, pas de transfert hors Union, pas de rate-limit, pas de risque de désactivation | 20 €/M (DGX Station) | 0.21 $/M (DeepSeek API) |
| Latence critique, temps réel | DeepSeek V4 Flash 0731 sur DGX Station | Latence P50 ~30 ms vs ~500 ms API, pas de rate-limit éditeur | 20 €/M (DGX Station) | 0.21 $/M (DeepSeek API) |
| Budget serré, faible volume | DeepSeek API V4 Flash 0731 | Coût par token le plus bas à 0.21 $/M, pas d'investissement matériel, pas de maintenance | n/a (API fermée) | 0.21 $/M (DeepSeek API) |
| Modèle ouvert le plus puissant | Kimi K3 | Meilleur sur l'Intelligence Index (79.2 %), 2 800B, 1M contexte, poids ~1 400 Go | Impossible sur DGX Station (1.4 To > 748 Go) | 0.35 $/M (OpenRouter) |
| Meilleur modèle ouvert sur l'Intelligence Index | GLM 5.2 | Meilleur sur l'Intelligence Index (73.2 %), 744B, 128 K contexte, poids ~370 Go | Impossible sur DGX Station (370 Go > 748 Go avec compression agressive) | 0.19 $/M (OpenRouter) |
Lecture : pour un déploiement local sur DGX Station GB300, le meilleur choix est DeepSeek V4 Flash 0731 (20 €/M local, 1M contexte, 14 utilisateurs concurrents en ctx 1M, 1 908 utilisateurs concurrents en ctx 8K). Pour un déploiement local sur DGX Spark 128 Go, le meilleur choix est DeepSeek V4 Flash 0731 en UD-IQ3_XXS (8 €/M local, 500 K contexte, 62 utilisateurs concurrents en ctx 8K, 0 en ctx 1M). Pour un usage API cloud sans investissement matériel, le meilleur choix est DeepSeek API V4 Flash 0731 (0.21 $/M, pas d'investissement, pas de maintenance, pas de rate-limit éditeur).
Comparatif des modèles open weight par matériel
| Modèle | DGX Spark 128 Go (UD-IQ3_XXS) | DGX Spark 128 Go (AWQ Q4) | Cluster 2× Spark 256 Go (UD-Q4_K_XL) | DGX Station GB300 748 Go (natif) | DGX Station GB300 748 Go (UD-Q8_K_XL) |
|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | Oui (104 Go, 500 K ctx, 62 users ctx 8K) | Oui (167 Go, 500 K ctx, 62 users ctx 8K) | Oui (155 Go, 1M ctx, 443 users ctx 8K) | Oui (167 Go, 1M ctx, 14 users ctx 1M, 1 908 users ctx 8K) | Oui (162 Go, 1M ctx, 13 users ctx 1M, 1 735 users ctx 8K) |
| Kimi K3 | Impossible (1 400 Go > 128 Go) | Impossible (1 400 Go > 128 Go) | Impossible (1 400 Go > 256 Go) | Impossible (1 400 Go > 748 Go) | Impossible (1 400 Go > 748 Go) |
| GLM 5.2 | Impossible (370 Go > 128 Go) | Impossible (370 Go > 128 Go) | Impossible (370 Go > 256 Go) | Impossible (370 Go > 748 Go avec compression agressive) | Impossible (370 Go > 748 Go avec compression agressive) |
| Qwen 3.7 | Impossible (118 Go > 128 Go avec compression agressive) | Oui (118 Go, 500 K ctx, 62 users ctx 8K) | Oui (118 Go, 1M ctx, 443 users ctx 8K) | Oui (118 Go, 1M ctx, 14 users ctx 1M, 1 908 users ctx 8K) | Oui (118 Go, 1M ctx, 13 users ctx 1M, 1 735 users ctx 8K) |
| DeepSeek V4 Pro | Impossible (800 Go > 128 Go) | Impossible (800 Go > 128 Go) | Impossible (800 Go > 256 Go) | Impossible (800 Go > 748 Go avec compression agressive) | Impossible (800 Go > 748 Go avec compression agressive) |
| Kimi K2.6 Thinking | Impossible (1 200 Go > 128 Go) | Impossible (1 200 Go > 128 Go) | Impossible (1 200 Go > 256 Go) | Impossible (1 200 Go > 748 Go) | Impossible (1 200 Go > 748 Go) |
| Kimi K2.7 Code | Impossible (1 400 Go > 128 Go) | Impossible (1 400 Go > 128 Go) | Impossible (1 400 Go > 256 Go) | Impossible (1 400 Go > 748 Go) | Impossible (1 400 Go > 748 Go) |
| MiniMax M3 | Impossible (214 Go > 128 Go) | Oui (214 Go, 500 K ctx, 62 users ctx 8K) | Oui (214 Go, 1M ctx, 443 users ctx 8K) | Oui (214 Go, 1M ctx, 14 users ctx 1M, 1 908 users ctx 8K) | Oui (214 Go, 1M ctx, 13 users ctx 1M, 1 735 users ctx 8K) |
| Qwen 3.6 Plus / Qwen 3.6 27B | Oui (118 Go, 500 K ctx, 62 users ctx 8K) / Oui (14 Go, 500 K ctx, 62 users ctx 8K) | Oui (118 Go, 500 K ctx, 62 users ctx 8K) / Oui (14 Go, 500 K ctx, 62 users ctx 8K) | Oui (118 Go, 1M ctx, 443 users ctx 8K) / Oui (14 Go, 1M ctx, 443 users ctx 8K) | Oui (118 Go, 1M ctx, 14 users ctx 1M, 1 908 users ctx 8K) / Oui (14 Go, 1M ctx, 14 users ctx 1M, 1 908 users ctx 8K) | Oui (118 Go, 1M ctx, 13 users ctx 1M, 1 735 users ctx 8K) / Oui (14 Go, 1M ctx, 13 users ctx 1M, 1 735 users ctx 8K) |
| Llama 3.1 70B | Oui (~70 Go, 500 K ctx, 62 users ctx 8K) | Oui (~70 Go, 500 K ctx, 62 users ctx 8K) | Oui (~70 Go, 1M ctx, 443 users ctx 8K) | Oui (~70 Go, 1M ctx, 14 users ctx 1M, 1 908 users ctx 8K) | Oui (~70 Go, 1M ctx, 13 users ctx 1M, 1 735 users ctx 8K) |
Lecture : pour un DGX Spark 128 Go, le meilleur modèle est DeepSeek V4 Flash 0731 en UD-IQ3_XXS (104 Go, 500 K contexte, 62 utilisateurs concurrents en ctx 8K, 0 en ctx 1M). Pour un cluster 2× DGX Spark 256 Go, le meilleur modèle est DeepSeek V4 Flash 0731 en UD-Q4_K_XL (155 Go, 1M contexte, 443 utilisateurs concurrents en ctx 8K, 3 en ctx 1M). Pour un DGX Station GB300 748 Go, le meilleur modèle est DeepSeek V4 Flash 0731 en natif (167 Go, 1M contexte, 14 utilisateurs concurrents en ctx 1M, 1 908 utilisateurs concurrents en ctx 8K) ou UD-Q8_K_XL lossless (162 Go, 1M contexte, 13 utilisateurs concurrents en ctx 1M, 1 735 utilisateurs concurrents en ctx 8K).
Comparatif des modèles open weight par coût total de possession (TCO) sur 3 ans
| Modèle | DGX Spark 128 Go (TCO 3 ans) | Cluster 2× Spark 256 Go (TCO 3 ans) | DGX Station GB300 748 Go (TCO 3 ans) | |
|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | ~12 000 € (acquisition + électricité + intégration + maintenance + formation) | ~25 000 € (acquisition + électricité + intégration + maintenance + formation) | ~200 000 € (acquisition + électricité + intégration + maintenance + formation) | 20 €/M (DGX Station) |
| Kimi K3 | Impossible (1 400 Go > 128 Go) | Impossible (1 400 Go > 256 Go) | Impossible (1 400 Go > 748 Go) | Impossible (1 400 Go > 748 Go) |
| GLM 5.2 | Impossible (370 Go > 128 Go) | Impossible (370 Go > 256 Go) | Impossible (370 Go > 748 Go avec compression agressive) | Impossible (370 Go > 748 Go avec compression agressive) |
| Qwen 3.7 | Impossible (118 Go > 128 Go avec compression agressive) | ~25 000 € (acquisition + électricité + intégration + maintenance + formation) | ~200 000 € (acquisition + électricité + intégration + maintenance + formation) | ~15 €/M (DGX Station) |
| DeepSeek V4 Pro | Impossible (800 Go > 128 Go) | Impossible (800 Go > 256 Go) | Impossible (800 Go > 748 Go avec compression agressive) | Impossible (800 Go > 748 Go avec compression agressive) |
| Kimi K2.6 Thinking | Impossible (1 200 Go > 128 Go) | Impossible (1 200 Go > 256 Go) | Impossible (1 200 Go > 748 Go) | Impossible (1 200 Go > 748 Go) |
| Kimi K2.7 Code | Impossible (1 400 Go > 128 Go) | Impossible (1 400 Go > 256 Go) | Impossible (1 400 Go > 748 Go) | Impossible (1 400 Go > 748 Go) |
| MiniMax M3 | Impossible (214 Go > 128 Go) | ~25 000 € (acquisition + électricité + intégration + maintenance + formation) | ~200 000 € (acquisition + électricité + intégration + maintenance + formation) | ~18 €/M (DGX Station) |
| Qwen 3.6 Plus / Qwen 3.6 27B | ~12 000 € (acquisition + électricité + intégration + maintenance + formation) / ~12 000 € (acquisition + électricité + intégration + maintenance + formation) | ~25 000 € (acquisition + électricité + intégration + maintenance + formation) / ~25 000 € (acquisition + électricité + intégration + maintenance + formation) | ~200 000 € (acquisition + électricité + intégration + maintenance + formation) / ~200 000 € (acquisition + électricité + intégration + maintenance + formation) | ~15 €/M (DGX Station) / ~8 €/M (DGX Spark) |
| Llama 3.1 70B | ~12 000 € (acquisition + électricité + intégration + maintenance + formation) | ~25 000 € (acquisition + électricité + intégration + maintenance + formation) | ~200 000 € (acquisition + électricité + intégration + maintenance + formation) | ~8 €/M (DGX Spark) |
Lecture : le coût total de possession sur 3 ans le plus bas est Llama 3.1 70B sur DGX Spark 128 Go (~12 000 €, ~8 €/M). Le coût total de possession sur 3 ans le plus bas pour un modèle de frontière est DeepSeek V4 Flash 0731 sur DGX Station GB300 (~200 000 €, 20 €/M). Le coût total de possession sur 3 ans le plus bas pour un modèle de frontière sans investissement matériel est DeepSeek API V4 Flash 0731 (0.21 $/M, pas d'investissement, pas de maintenance, pas de rate-limit éditeur).
Comparatif des modèles open weight par licence et souveraineté
| Modèle | Licence | Poids ouverts | Exécution en local | Transfert de données | Rate-limit éditeur | Risque de désactivation | RGPD by design | HDS / SecNumCloud | Fine-tuning sur données métier |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | MIT | Oui | Oui | Aucun (sur site) | Aucun | Aucun (poids ouverts) | Oui | Compatible | Oui (Unsloth) |
| Kimi K3 | MIT | Oui | Non (1 400 Go > 748 Go) | Aucun (sur site) | Aucun | Aucun (poids ouverts) | Oui | Compatible | Oui (Unsloth) |
| GLM 5.2 | MIT | Oui | Non (370 Go > 748 Go avec compression agressive) | Aucun (sur site) | Aucun | Aucun (poids ouverts) | Oui | Compatible | Oui (Unsloth) |
| Qwen 3.7 | Apache 2.0 | Oui | Non (118 Go > 128 Go avec compression agressive) | Aucun (sur site) | Aucun | Aucun (poids ouverts) | Oui | Compatible | Oui (Unsloth) |
| DeepSeek V4 Pro | MIT | Oui | Non (800 Go > 748 Go avec compression agressive) | Aucun (sur site) | Aucun | Aucun (poids ouverts) | Oui | Compatible | Oui (Unsloth) |
| Kimi K2.6 Thinking | MIT | Oui | Non (1 200 Go > 748 Go) | Aucun (sur site) | Aucun | Aucun (poids ouverts) | Oui | Compatible | Oui (Unsloth) |
| Kimi K2.7 Code | MIT | Oui | Non (1 400 Go > 748 Go) | Aucun (sur site) | Aucun | Aucun (poids ouverts) | Oui | Compatible | Oui (Unsloth) |
| MiniMax M3 | MIT | Oui | Non (214 Go > 128 Go) | Aucun (sur site) | Aucun | Aucun (poids ouverts) | Oui | Compatible | Oui (Unsloth) |
| Qwen 3.6 Plus / Qwen 3.6 27B | Apache 2.0 | Oui | Oui | Aucun (sur site) | Aucun | Aucun (poids ouverts) | Oui | Compatible | Oui (Unsloth) |
| Llama 3.1 70B | CC-BY-NC 4.0 | Oui | Oui | Aucun (sur site) | Aucun | Aucun (poids ouverts) | Oui | Compatible | Oui (Unsloth) |
Lecture : pour la souveraineté et la conformité RGPD/HDS/SecNumCloud, le meilleur choix est DeepSeek V4 Flash 0731 en local (licence MIT, poids ouverts, exécution en local, pas de transfert hors Union, pas de rate-limit, pas de risque de désactivation, fine-tuning possible sur des données métier spécifiques). Pour un usage API cloud sans investissement matériel, le meilleur choix est DeepSeek API V4 Flash 0731 (licence MIT, pas d'investissement, pas de maintenance, pas de rate-limit éditeur).
Conclusion : quel modèle open weight pour quel cas d'usage
| Cas d'usage | Modèle recommandé | Justification |
|---|---|---|
| Agents de code, ingénierie logicielle | DeepSeek V4 Flash 0731 | Meilleur sur Terminal Bench 2.1, NL2Repo, DeepSWE, Toolathlon. 82.7 % vs ~75 % Claude Opus 5. |
| Raisonnement général, précision | Claude Opus 5 (API fermée) | Meilleur sur MMLU-Pro, GPQA, AIME, Humanity's Last Exam, AA-Omniscience. ~88 % vs 86.6 % DeepSeek V4 Flash 0731. |
| Chat généraliste, économique | DeepSeek API V4 Flash 0731 | Coût par token le plus bas à 0.21 $/M. Meilleur sur les benchmarks agentiques. |
| Données sensibles, RGPD, HDS, SecNumCloud | DeepSeek V4 Flash 0731 en local | Poids ouverts, exécution en local, pas de transfert hors Union, pas de rate-limit, pas de risque de désactivation. |
| Fine-tuning sur données métier | DeepSeek V4 Flash 0731 (Unsloth) | Poids ouverts, fine-tuning QLoRA possible avec Unsloth, lossless en quantization QAT-aware. |
| Latence critique, temps réel | DeepSeek V4 Flash 0731 sur DGX Station | Latence P50 ~30 ms vs ~500 ms API, pas de rate-limit éditeur. |
| Budget serré, faible volume | DeepSeek API V4 Flash 0731 | Coût par token le plus bas à 0.21 $/M, pas d'investissement matériel, pas de maintenance. |
| Modèle ouvert le plus puissant | Kimi K3 | Meilleur sur l'Intelligence Index (79.2 %), 2 800B, 1M contexte, poids ~1 400 Go. |
| Meilleur modèle ouvert sur l'Intelligence Index | GLM 5.2 | Meilleur sur l'Intelligence Index (73.2 %), 744B, 128 K contexte, poids ~370 Go. |
| Modèle compact (TPE) | Qwen 3.6 27B ou Gemma 4 | Léger (~14 Go / ~9 Go), rapide, économique, tient sur un PC récent ou un Mac Studio. |
Évaluer votre déploiement de modèle open weight
Un échange sans engagement pour cadrer votre cas d'usage (agents de code, service client, documentation interne, raisonnement général), choisir entre DeepSeek V4 Flash 0731 en local, DeepSeek API, Claude Opus 5 et GPT-5.5, et valider la recette vLLM sur votre infrastructure.
Réserver un échangeRéférences
- DeepSeek V4 Flash 0731, dépôt officiel Hugging Face
- Rapport technique DeepSeek V4 (arXiv 2606.19348)
- Artificial Analysis Intelligence Index v4.1
- LiveBench open weight rankings
- OpenRouter model rankings
- Unsloth, documentation DeepSeek V4
- Fiche QDNA : DeepSeek V4
- Fiche QDNA : vLLM
- Fiche QDNA : DGX Station
- Fiche QDNA : DGX Spark
Questions fréquentes
Quel est le meilleur modèle open weight pour un déploiement local en 2026 ?
Selon les benchmarks officiels et les rankings OpenRouter, le meilleur modèle open weight pour un déploiement local en 2026 est DeepSeek V4 Flash 0731 (284B / 13B actifs, contexte 1M, poids FP4+FP8). Il dépasse Claude Opus 5 sur Terminal Bench 2.1 (82.7% vs ~75%) et NL2Repo (54.2% vs ~45%), et il reste compétitif avec Claude Opus 5 sur MMLU-Pro (86.6% vs ~88%) et GPQA Diamond (74.9% vs ~77%). Pour un usage général, GLM 5.2 (744B) est le meilleur modèle ouvert sur l'Intelligence Index. Pour un usage agentique et code, DeepSeek V4 Flash 0731 est le meilleur choix.
Quelle est la différence entre DeepSeek V4 Flash 0731 et V4 Pro ?
V4 Flash 0731 est un MoE de 284 milliards de paramètres avec 13 milliards actifs par token, contexte 1M, et il dépasse V4 Pro (1.6T, 49B actifs) sur tous les benchmarks agentiques publiés par DeepSeek (Terminal Bench 2.1, NL2Repo, Cybergym, DeepSWE, Toolathlon). V4 Pro reste en preview et n'a pas reçu de révision 0731.
Quel modèle open weight a le meilleur rapport qualité/taille pour un DGX Spark 128 Go ?
Pour un DGX Spark 128 Go, le meilleur rapport qualité/taille est DeepSeek V4 Flash 0731 en UD-IQ3_XXS (104 Go). C'est le modèle le plus qualitatif qui tient sur 128 Go avec une marge de 18 Go pour le KV cache, et il conserve ~100 % de la qualité sur les benchmarks publiés. Le deuxième choix est Llama 3.1 70B en AWQ Q4 (~35 Go), qui tient largement sur 128 Go avec une marge de ~93 Go pour le KV cache et les utilisateurs concurrents.
Quel modèle open weight a le meilleur rapport qualité/taille pour un DGX Station GB300 ?
Pour un DGX Station GB300 (748 Go cohérente), le meilleur rapport qualité/taille est DeepSeek V4 Flash 0731 en natif FP4+FP8 (167 Go) ou UD-Q8_K_XL lossless (162 Go). Il permet le 1M contexte natif avec 14 utilisateurs concurrents en ctx 1M, ou 1 908 utilisateurs concurrents en ctx 8K, et il conserve ~100 % de la qualité sur les benchmarks publiés. Le deuxième choix est GLM 5.2 (744 Go) en natif, qui est le meilleur modèle ouvert sur l'Intelligence Index.
Comment déployer un modèle open weight en local sur DGX Spark ou DGX Station ?
Utilisez les GGUFs Unsloth Dynamic (UD-IQ3_XXS 104 Go recommandé pour 128 Go, UD-Q8_K_XL lossless 162 Go) avec vLLM 0.25+ ou Ollama. Pour un déploiement sur DGX Spark (128 Go) : docker pull nvcr.io/nvidia/vllm:25.04-py3-aarch64, puis vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 --trust-remote-code --kv-cache-dtype fp8 --enable-expert-parallel. Pour un cluster 2× Spark : relier les deux Spark par ConnectX-7 200 Gb/s et utiliser --tensor-parallel-size 2. Pour un DGX Station GB300 : utilisez la même commande avec --tensor-parallel-size 1.