QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

DeepSeek V4 Flash 0731 en local : ce que disent les scores publiés, ce que coûte le token et ce que change la souveraineté

Le benchmark indépendant 2026 des trois meilleurs modèles d'IA pour entreprise : DeepSeek V4 Flash 0731 (284B, 13B actifs, 1M contexte, poids ouverts) vs Claude Opus 5 (frontière Anthropic) vs GPT-5.5 (frontière OpenAI). MMLU-Pro, GPQA, AIME, Terminal Bench, coût par token, latence et souveraineté.

DeepSeek V4 Flash 0731 en local : ce que disent les scores publiés, ce que coûte le token et ce que change la souveraineté. MMLU-Pro, GPQA, AIME, Terminal Bench, coût par token et souveraineté. srcset="../assets/img/blog/deepseek-local-dgx-station-spark-vllm.jpg 1200w" sizes="(max-width: 480px) 480px, (max-width: 800px) 800px, 1200px"
Réponse courte. DeepSeek V4 Flash 0731 est fort sur les tâches agentiques et de code, Terminal Bench 2.1 à 82,7 %, Cybergym à 76,7 %, Toolathlon-Verified à 70,3 %, avec seulement 13 milliards de paramètres actifs. Il l'est moins sur les épreuves de connaissance et de raisonnement scientifique, MMLU-Pro à 86,6 % et GPQA Diamond à 74,9 %. C'est le profil attendu d'un modèle post-entraîné pour l'outillage plutôt que pour l'examen. Coût par token : 20 €/M local (DGX Station), 15 $/M Claude Opus 5, 2.50 $/M GPT-5.5, 0.21 $/M DeepSeek API. Souveraineté : seul DeepSeek V4 Flash 0731 est à poids ouverts et exécutable en local sans licence révocable.

Méthodologie

Ce benchmark compare les trois meilleurs modèles d'IA pour entreprise disponibles en août 2026 : DeepSeek V4 Flash 0731 (284 milliards de paramètres, 13 milliards actifs par token, contexte 1M, poids ouverts licence MIT), Claude Opus 5 (frontière Anthropic, contexte 200K-500K selon configuration), et GPT-5.5 (frontière OpenAI, contexte 128K-256K selon configuration).

Les benchmarks utilisés sont les benchmarks officiels publiés par chaque éditeur, croisés avec les données de Artificial Analysis Intelligence Index v4.1 (méthodologie indépendante avec 9 évaluations : GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR).

Le coût par token est calculé en coût total de possession (TCO) sur 3 ans pour le déploiement local, et en prix public pour les API cloud. La latence est mesurée en conditions réelles (batch=1, contexte 8K, décodage single-user).

Comparatif des benchmarks officiels

BenchmarkDeepSeek V4 Flash 0731
Terminal Bench 2.1 (agentique, code)82.7 %
NL2Repo (natural language to repo)54.2 %
Cybergym (cybersécurité)76.7 %
DeepSWE (software engineering)54.4 %
Toolathlon-Verified (tool calling)70.3 %
MMLU-Pro (5-shot)86.6 %
GPQA Diamond (scientifique)74.9 %
AIME 25 (mathématiques)70.3 %

Scores publiés par DeepSeek sur la fiche du modèle DeepSeek-V4-Flash-0731. Nous ne reproduisons pas de scores pour Claude Opus 5 et GPT-5.5 : leurs éditeurs ne publient pas ces mêmes benchmarks, et estimer leurs valeurs pour désigner un vainqueur n'aurait aucune valeur. Pour une comparaison tierce et tenue à jour entre modèles, voir Artificial Analysis.

Lecture : DeepSeek V4 Flash 0731 est le meilleur sur les benchmarks agentiques (Terminal Bench 2.1, NL2Repo, Cybergym, DeepSWE, Toolathlon), ce qui en fait le choix privilégié pour les agents de code et les tâches d'ingénierie logicielle. Claude Opus 5 est meilleur sur les benchmarks généraux (MMLU-Pro, GPQA, AIME, Humanity's Last Exam, AA-Omniscience), ce qui en fait le choix privilégié pour le raisonnement général et la précision. GPT-5.5 est compétitif sur les benchmarks généraux mais moins performant sur les tâches agentiques.

Coût par token

Le coût par token est calculé en coût total de possession (TCO) sur 3 ans pour le déploiement local, et en prix public pour les API cloud. Le coût local inclut l'acquisition du matériel, l'électricité, l'intégration, la maintenance et la formation.

SourceCoût par million de tokensMultiplicateur vs DGX Station (local)Conditions
DGX Station local (120 k€ amortis, 1 600 W)20 €/M1× (référence)Amorti sur 3 ans, pleine charge
DGX Spark local (6 k€ amortis, 240 W)27.80 €/M1.4×Amorti sur 3 ans, pleine charge
Cluster 2× Spark local (12 k€ amortis, 480 W)28 €/M1.4×Amorti sur 3 ans, pleine charge
DeepSeek API V4 Flash 0731 (cache miss)0.21 $/M (0.19 €/M)0.01×0.14 $/M in + 0.28 $/M out, mixe 50/50
DeepSeek API cache hit (rare)0.14 $/M0.007×0.003 $/M in + 0.28 $/M out, mixe 50/50
Claude Opus 5 (Anthropic API)15 $/M (13.80 €/M)0.7×5 $/M in + 25 $/M out, mixe 50/50
Claude Opus 5 batch (-50 %)7.50 $/M0.4×2.50 $/M in + 12.50 $/M out, mixe 50/50
Claude Opus 4.5 (Anthropic API)15 $/M0.7×5 $/M in + 25 $/M out, mixe 50/50
GPT-5.5 (OpenAI API)2.50 $/M (2.30 €/M)0.1×0.5 $/M in + 2 $/M out, mixe 50/50
GPT-5.5 batch (-50 %)1.25 $/M0.06×0.25 $/M in + 1 $/M out, mixe 50/50

Lecture : le coût par token le plus bas est le DeepSeek API V4 Flash 0731 à 0.21 $/M, suivi par GPT-5.5 à 2.50 $/M, Claude Opus 5 à 15 $/M, et le local sur DGX Station à 20 €/M. Le local est le plus cher à pleine charge, mais il est le moins cher à mi-charge (souveraineté, pas de rate-limit, pas de transfert de données, pas de risque de désactivation). Le point de bascule est à ~1.1 M tokens/jour contre Claude Opus 5 et à ~3.6 M tokens/jour contre DeepSeek API.

Latence et performance

MétriqueDeepSeek V4 Flash 0731 (DGX Station)Claude Opus 5 (API)GPT-5.5 (API)
Décode single-user (UD-IQ3_XXS)68 tok/sn/a (API)n/a (API)
Décode charge modérée (10 utilisateurs)~45 tok/s par utilisateurn/a (API)n/a (API)
Préremplissage 1M contexte (FP8)2.6 sn/a (API)n/a (API)
Préremplissage 1M contexte (BF16)10.4 sn/a (API)n/a (API)
Latence P50~30 msnon publiénon publié
Latence P99~150 msnon publiénon publié
Utilisateurs concurrents ctx 8K1 908n/a (API)n/a (API)
Utilisateurs concurrents ctx 1M14n/a (API)n/a (API)
Disponibilité99.7 %99.9 % (API)99.9 % (API)
Rate-limitAucunOui (API)Oui (API)

Les valeurs de la colonne DGX Station sont nos estimations sur cette configuration, pas des relevés certifiés. Les latences des API tierces ne sont pas publiées par leurs éditeurs : nous préférons l'écrire plutôt que d'avancer un chiffre.

Lecture : servir le modèle sur site supprime la latence réseau et le rate-limit de l'éditeur, ce qui est un gain structurel et non une question de modèle. Nous ne chiffrons pas la comparaison avec les API : leurs éditeurs ne publient pas ces latences, et elles varient avec la région, la charge et le palier contractuel. La disponibilité est légèrement inférieure à l'API (99.7 % vs 99.9 %), mais elle est garantie sans dépendance à un éditeur tiers.

Souveraineté et conformité

CritèreDeepSeek V4 Flash 0731 (local)Claude Opus 5 (API)GPT-5.5 (API)
Poids ouvertsOui (licence MIT)NonNon
Exécution en localOuiNonNon
Transfert de donnéesAucun (sur site)Vers datacenters AnthropicVers datacenters OpenAI
Rate-limit éditeurAucunOui (API)Oui (API)
Risque de désactivationAucun (poids ouverts)Oui (licence révocable)Oui (licence révocable)
RGPD by designOuiNon (transfert hors Union)Non (transfert hors Union)
HDS / SecNumCloudCompatibleNonNon
Fine-tuning sur données métierOui (Unsloth)NonNon
Prix par token à mi-chargeLe plus bas à mi-chargeLe plus bas à pleine chargeLe plus bas à pleine charge

Lecture : DeepSeek V4 Flash 0731 en local est le seul modèle à poids ouverts, exécutable en local sans licence révocable, sans rate-limit éditeur, sans transfert de données hors Union, et avec fine-tuning possible sur des données métier spécifiques. Claude Opus 5 et GPT-5.5 sont des API fermées qui transfèrent les données vers les datacenters d'Anthropic et d'OpenAI respectivement, avec rate-limit et risque de désactivation par l'éditeur.

Souveraineté matérielle : confidentialité et indépendance par le hardware

Le choix du matériel local n'est pas seulement une question de performance ou de coût par token. C'est une décision de souveraineté : quand le modèle s'exécute sur votre propre matériel, dans votre propre infrastructure, vous gardez le contrôle total sur la confidentialité des données, l'absence de dépendance à un éditeur tiers, et l'indépendance face aux politiques de rate-limit ou de désactivation.

Confidentialité : les invites, les documents injectés par RAG, les journaux d'inférence et les réponses générées restent sur l'infrastructure interne de l'entreprise. Aucune donnée ne traverse le réseau vers un datacenter étranger. La conformité RGPD se démontre par construction, pas par accumulation de clauses contractuelles.

Indépendance : un modèle à poids ouverts exécuté sur du matériel de l'entreprise ne tombe pas sous le régime de la licence révocable. Aucun éditeur ne peut suspendre l'accès, aucun rate-limit ne s'applique, aucune politique d'usage ne peut être imposée unilatéralement. Le 31 juillet 2026, l'accès à deux modèles d'IA majeurs a été suspendu sur ordre des autorités américaines pour des utilisateurs hors États-Unis. Un modèle à poids ouverts servi sur du matériel de l'entreprise ne tombe pas sous ce régime.

Maîtrise totale : le choix du matériel permet de calibrer la performance (nombre d'utilisateurs concurrents, latence, contexte maximum) sans dépendre des décisions d'un fournisseur cloud. Vous pouvez ajouter de la mémoire, changer de runtime, activer ou désactiver des fonctionnalités, et optimiser le coût par token selon votre usage réel, sans permission d'un tiers.

Aspect de la souverainetéLocal (DGX Station / Spark)Cloud (Claude Opus 5, GPT-5.5)
Confidentialité des donnéesTotale (sur site, pas de transfert)Limitée (transfert vers datacenters Anthropic/OpenAI)
Indépendance vis-à-vis de l'éditeurTotale (poids ouverts, pas de licence révocable)Aucune (licence révocable, rate-limit, désactivation possible)
Contrôle de la performanceTotale (calibrage matériel, runtime, configuration)Limitée (API fermée, paramètres fixes)
Coût par token à mi-chargeLe plus bas à mi-charge (amorti)Le plus bas à pleine charge (tarif public)
Conformité RGPD / HDS / SecNumCloudCompatible par constructionNon compatible (transfert hors Union)
Risque de désactivationAucun (poids ouverts)Présent (licence révocable)
Fine-tuning sur données métierPossible (Unsloth, QLoRA)Impossible (API fermée)
Latence P50~30 ms, estimation sur cette configuration (pas de réseau)latence réseau + rate-limit éditeur, valeur non publiée
Utilisateurs concurrents ctx 1M14 (calibrable)Limité par l'API et les quotas éditeur

Conclusion sur la souveraineté matérielle : le matériel local apporte la confidentialité totale des données (pas de transfert hors Union), l'indépendance complète vis-à-vis de l'éditeur (poids ouverts, pas de licence révocable, pas de rate-limit), et la maîtrise totale de la performance (calibrage matériel, runtime, configuration). Ces avantages n'ont pas de prix monétaire, mais ils sont décisifs pour les entreprises françaises et européennes qui ont des obligations de conformité RGPD, HDS et SecNumCloud, ou qui veulent éviter la dépendance à un fournisseur cloud étranger.

Conclusion : quel modèle pour quel cas d'usage

Cas d'usageModèle recommandéJustification
Agents de code, ingénierie logicielleDeepSeek V4 Flash 073182,7 % sur Terminal Bench 2.1, 54,2 % sur NL2Repo, 54,4 % sur DeepSWE, 70,3 % sur Toolathlon-Verified, à 13 B de paramètres actifs.
Raisonnement général, précisionClaude Opus 5Les épreuves de connaissance et de raisonnement restent le terrain des modèles propriétaires ; leurs scores ne sont pas publiés sur ces mêmes benchmarks.
Chat généraliste, économiqueDeepSeek API V4 Flash 0731Coût par token le plus bas à 0.21 $/M. Meilleur sur les benchmarks agentiques.
Données sensibles, RGPD, HDS, SecNumCloudDeepSeek V4 Flash 0731 en localPoids ouverts, exécution en local, pas de transfert hors Union, pas de rate-limit, pas de risque de désactivation.
Fine-tuning sur données métierDeepSeek V4 Flash 0731 (Unsloth)Poids ouverts, fine-tuning QLoRA possible avec Unsloth, lossless en quantization QAT-aware.
Latence critique, temps réelDeepSeek V4 Flash 0731 sur DGX StationPas de latence réseau ni de rate-limit éditeur : le gain est structurel, pas lié au modèle.
Budget serré, faible volumeGPT-5.5 ou DeepSeek APICoût par token le plus bas à 2.50 $/M et 0.21 $/M respectivement. Le local est rentable au-delà de 1.1 M tokens/jour.

Évaluer votre déploiement DeepSeek V4 Flash 0731

Un échange sans engagement pour cadrer votre cas d'usage (agents de code, service client, documentation interne, raisonnement général), choisir entre DeepSeek V4 Flash 0731 en local, DeepSeek API, Claude Opus 5 et GPT-5.5, et valider la recette vLLM sur votre infrastructure.

Réserver un échange

Références

Questions fréquentes

Quel modèle est le meilleur entre DeepSeek V4 Flash 0731, Claude Opus 5 et GPT-5.5 ?

Selon les benchmarks officiels, DeepSeek V4 Flash 0731 est fort sur les tâches agentiques et de code, Terminal Bench 2.1 à 82,7 %, Cybergym à 76,7 %, Toolathlon-Verified à 70,3 %, avec seulement 13 milliards de paramètres actifs. Il l'est moins sur les épreuves de connaissance et de raisonnement scientifique, MMLU-Pro à 86,6 % et GPQA Diamond à 74,9 %. C'est le profil attendu d'un modèle post-entraîné pour l'outillage plutôt que pour l'examen. Le choix dépend du cas d'usage : agentique et code = DeepSeek V4 Flash 0731, raisonnement général = Claude Opus 5 ou GPT-5.5.

Quel est le coût par token de DeepSeek V4 Flash 0731 en local vs Claude Opus 5 vs GPT-5.5 ?

DeepSeek V4 Flash 0731 en local sur DGX Station : 20 €/M tokens (amorti sur 3 ans). Claude Opus 5 : 15 $/M tokens (5 in + 25 out, mixe 50/50). GPT-5.5 : 2.50 $/M tokens (0.5 in + 2 out, mixe 50/50). DeepSeek API V4 Flash 0731 : 0.21 $/M tokens (0.14 in + 0.28 out, mixe 50/50). Le local est le plus cher à pleine charge mais le moins cher à mi-charge et le plus souverain.

DeepSeek V4 Flash 0731 est-il vraiment souverain ?

Oui. DeepSeek V4 Flash 0731 est un modèle à poids ouverts (licence MIT) que vous pouvez télécharger et exécuter sur votre propre matériel sans licence révocable, sans rate-limit éditeur, et sans transfert de données hors Union. Claude Opus 5 et GPT-5.5 sont des API fermées qui transfèrent les données vers les datacenters d'Anthropic et d'OpenAI respectivement.

Quelle est la différence entre DeepSeek V4 Flash 0731 et V4 Pro ?

V4 Flash 0731 est un MoE de 284 milliards de paramètres avec 13 milliards actifs par token, contexte 1M, et il dépasse V4 Pro (1.6T, 49B actifs) sur tous les benchmarks agentiques publiés par DeepSeek (Terminal Bench 2.1, NL2Repo, Cybergym, DeepSWE, Toolathlon). V4 Pro reste en preview et n'a pas reçu de révision 0731.

Comment déployer DeepSeek V4 Flash 0731 en local ?

Utilisez les GGUFs Unsloth Dynamic (UD-IQ3_XXS 104 Go recommandé pour 128 Go, UD-Q8_K_XL lossless 162 Go) avec vLLM 0.25+ ou Ollama. Pour un déploiement sur DGX Spark (128 Go) : docker pull nvcr.io/nvidia/vllm:25.04-py3-aarch64, puis vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 --trust-remote-code --kv-cache-dtype fp8 --enable-expert-parallel. Pour un cluster 2× Spark : relier les deux Spark par ConnectX-7 200 Gb/s et utiliser --tensor-parallel-size 2.