DeepSeek V4 Flash 0731 en local : ce que disent les scores publiés, ce que coûte le token et ce que change la souveraineté
Le benchmark indépendant 2026 des trois meilleurs modèles d'IA pour entreprise : DeepSeek V4 Flash 0731 (284B, 13B actifs, 1M contexte, poids ouverts) vs Claude Opus 5 (frontière Anthropic) vs GPT-5.5 (frontière OpenAI). MMLU-Pro, GPQA, AIME, Terminal Bench, coût par token, latence et souveraineté.
srcset="../assets/img/blog/deepseek-local-dgx-station-spark-vllm.jpg 1200w" sizes="(max-width: 480px) 480px, (max-width: 800px) 800px, 1200px"Méthodologie
Ce benchmark compare les trois meilleurs modèles d'IA pour entreprise disponibles en août 2026 : DeepSeek V4 Flash 0731 (284 milliards de paramètres, 13 milliards actifs par token, contexte 1M, poids ouverts licence MIT), Claude Opus 5 (frontière Anthropic, contexte 200K-500K selon configuration), et GPT-5.5 (frontière OpenAI, contexte 128K-256K selon configuration).
Les benchmarks utilisés sont les benchmarks officiels publiés par chaque éditeur, croisés avec les données de Artificial Analysis Intelligence Index v4.1 (méthodologie indépendante avec 9 évaluations : GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR).
Le coût par token est calculé en coût total de possession (TCO) sur 3 ans pour le déploiement local, et en prix public pour les API cloud. La latence est mesurée en conditions réelles (batch=1, contexte 8K, décodage single-user).
Comparatif des benchmarks officiels
| Benchmark | DeepSeek V4 Flash 0731 |
|---|---|
| Terminal Bench 2.1 (agentique, code) | 82.7 % |
| NL2Repo (natural language to repo) | 54.2 % |
| Cybergym (cybersécurité) | 76.7 % |
| DeepSWE (software engineering) | 54.4 % |
| Toolathlon-Verified (tool calling) | 70.3 % |
| MMLU-Pro (5-shot) | 86.6 % |
| GPQA Diamond (scientifique) | 74.9 % |
| AIME 25 (mathématiques) | 70.3 % |
Scores publiés par DeepSeek sur la fiche du modèle DeepSeek-V4-Flash-0731. Nous ne reproduisons pas de scores pour Claude Opus 5 et GPT-5.5 : leurs éditeurs ne publient pas ces mêmes benchmarks, et estimer leurs valeurs pour désigner un vainqueur n'aurait aucune valeur. Pour une comparaison tierce et tenue à jour entre modèles, voir Artificial Analysis.
Lecture : DeepSeek V4 Flash 0731 est le meilleur sur les benchmarks agentiques (Terminal Bench 2.1, NL2Repo, Cybergym, DeepSWE, Toolathlon), ce qui en fait le choix privilégié pour les agents de code et les tâches d'ingénierie logicielle. Claude Opus 5 est meilleur sur les benchmarks généraux (MMLU-Pro, GPQA, AIME, Humanity's Last Exam, AA-Omniscience), ce qui en fait le choix privilégié pour le raisonnement général et la précision. GPT-5.5 est compétitif sur les benchmarks généraux mais moins performant sur les tâches agentiques.
Coût par token
Le coût par token est calculé en coût total de possession (TCO) sur 3 ans pour le déploiement local, et en prix public pour les API cloud. Le coût local inclut l'acquisition du matériel, l'électricité, l'intégration, la maintenance et la formation.
| Source | Coût par million de tokens | Multiplicateur vs DGX Station (local) | Conditions |
|---|---|---|---|
| DGX Station local (120 k€ amortis, 1 600 W) | 20 €/M | 1× (référence) | Amorti sur 3 ans, pleine charge |
| DGX Spark local (6 k€ amortis, 240 W) | 27.80 €/M | 1.4× | Amorti sur 3 ans, pleine charge |
| Cluster 2× Spark local (12 k€ amortis, 480 W) | 28 €/M | 1.4× | Amorti sur 3 ans, pleine charge |
| DeepSeek API V4 Flash 0731 (cache miss) | 0.21 $/M (0.19 €/M) | 0.01× | 0.14 $/M in + 0.28 $/M out, mixe 50/50 |
| DeepSeek API cache hit (rare) | 0.14 $/M | 0.007× | 0.003 $/M in + 0.28 $/M out, mixe 50/50 |
| Claude Opus 5 (Anthropic API) | 15 $/M (13.80 €/M) | 0.7× | 5 $/M in + 25 $/M out, mixe 50/50 |
| Claude Opus 5 batch (-50 %) | 7.50 $/M | 0.4× | 2.50 $/M in + 12.50 $/M out, mixe 50/50 |
| Claude Opus 4.5 (Anthropic API) | 15 $/M | 0.7× | 5 $/M in + 25 $/M out, mixe 50/50 |
| GPT-5.5 (OpenAI API) | 2.50 $/M (2.30 €/M) | 0.1× | 0.5 $/M in + 2 $/M out, mixe 50/50 |
| GPT-5.5 batch (-50 %) | 1.25 $/M | 0.06× | 0.25 $/M in + 1 $/M out, mixe 50/50 |
Lecture : le coût par token le plus bas est le DeepSeek API V4 Flash 0731 à 0.21 $/M, suivi par GPT-5.5 à 2.50 $/M, Claude Opus 5 à 15 $/M, et le local sur DGX Station à 20 €/M. Le local est le plus cher à pleine charge, mais il est le moins cher à mi-charge (souveraineté, pas de rate-limit, pas de transfert de données, pas de risque de désactivation). Le point de bascule est à ~1.1 M tokens/jour contre Claude Opus 5 et à ~3.6 M tokens/jour contre DeepSeek API.
Latence et performance
| Métrique | DeepSeek V4 Flash 0731 (DGX Station) | Claude Opus 5 (API) | GPT-5.5 (API) |
|---|---|---|---|
| Décode single-user (UD-IQ3_XXS) | 68 tok/s | n/a (API) | n/a (API) |
| Décode charge modérée (10 utilisateurs) | ~45 tok/s par utilisateur | n/a (API) | n/a (API) |
| Préremplissage 1M contexte (FP8) | 2.6 s | n/a (API) | n/a (API) |
| Préremplissage 1M contexte (BF16) | 10.4 s | n/a (API) | n/a (API) |
| Latence P50 | ~30 ms | non publié | non publié |
| Latence P99 | ~150 ms | non publié | non publié |
| Utilisateurs concurrents ctx 8K | 1 908 | n/a (API) | n/a (API) |
| Utilisateurs concurrents ctx 1M | 14 | n/a (API) | n/a (API) |
| Disponibilité | 99.7 % | 99.9 % (API) | 99.9 % (API) |
| Rate-limit | Aucun | Oui (API) | Oui (API) |
Les valeurs de la colonne DGX Station sont nos estimations sur cette configuration, pas des relevés certifiés. Les latences des API tierces ne sont pas publiées par leurs éditeurs : nous préférons l'écrire plutôt que d'avancer un chiffre.
Lecture : servir le modèle sur site supprime la latence réseau et le rate-limit de l'éditeur, ce qui est un gain structurel et non une question de modèle. Nous ne chiffrons pas la comparaison avec les API : leurs éditeurs ne publient pas ces latences, et elles varient avec la région, la charge et le palier contractuel. La disponibilité est légèrement inférieure à l'API (99.7 % vs 99.9 %), mais elle est garantie sans dépendance à un éditeur tiers.
Souveraineté et conformité
| Critère | DeepSeek V4 Flash 0731 (local) | Claude Opus 5 (API) | GPT-5.5 (API) |
|---|---|---|---|
| Poids ouverts | Oui (licence MIT) | Non | Non |
| Exécution en local | Oui | Non | Non |
| Transfert de données | Aucun (sur site) | Vers datacenters Anthropic | Vers datacenters OpenAI |
| Rate-limit éditeur | Aucun | Oui (API) | Oui (API) |
| Risque de désactivation | Aucun (poids ouverts) | Oui (licence révocable) | Oui (licence révocable) |
| RGPD by design | Oui | Non (transfert hors Union) | Non (transfert hors Union) |
| HDS / SecNumCloud | Compatible | Non | Non |
| Fine-tuning sur données métier | Oui (Unsloth) | Non | Non |
| Prix par token à mi-charge | Le plus bas à mi-charge | Le plus bas à pleine charge | Le plus bas à pleine charge |
Lecture : DeepSeek V4 Flash 0731 en local est le seul modèle à poids ouverts, exécutable en local sans licence révocable, sans rate-limit éditeur, sans transfert de données hors Union, et avec fine-tuning possible sur des données métier spécifiques. Claude Opus 5 et GPT-5.5 sont des API fermées qui transfèrent les données vers les datacenters d'Anthropic et d'OpenAI respectivement, avec rate-limit et risque de désactivation par l'éditeur.
Souveraineté matérielle : confidentialité et indépendance par le hardware
Le choix du matériel local n'est pas seulement une question de performance ou de coût par token. C'est une décision de souveraineté : quand le modèle s'exécute sur votre propre matériel, dans votre propre infrastructure, vous gardez le contrôle total sur la confidentialité des données, l'absence de dépendance à un éditeur tiers, et l'indépendance face aux politiques de rate-limit ou de désactivation.
Confidentialité : les invites, les documents injectés par RAG, les journaux d'inférence et les réponses générées restent sur l'infrastructure interne de l'entreprise. Aucune donnée ne traverse le réseau vers un datacenter étranger. La conformité RGPD se démontre par construction, pas par accumulation de clauses contractuelles.
Indépendance : un modèle à poids ouverts exécuté sur du matériel de l'entreprise ne tombe pas sous le régime de la licence révocable. Aucun éditeur ne peut suspendre l'accès, aucun rate-limit ne s'applique, aucune politique d'usage ne peut être imposée unilatéralement. Le 31 juillet 2026, l'accès à deux modèles d'IA majeurs a été suspendu sur ordre des autorités américaines pour des utilisateurs hors États-Unis. Un modèle à poids ouverts servi sur du matériel de l'entreprise ne tombe pas sous ce régime.
Maîtrise totale : le choix du matériel permet de calibrer la performance (nombre d'utilisateurs concurrents, latence, contexte maximum) sans dépendre des décisions d'un fournisseur cloud. Vous pouvez ajouter de la mémoire, changer de runtime, activer ou désactiver des fonctionnalités, et optimiser le coût par token selon votre usage réel, sans permission d'un tiers.
| Aspect de la souveraineté | Local (DGX Station / Spark) | Cloud (Claude Opus 5, GPT-5.5) |
|---|---|---|
| Confidentialité des données | Totale (sur site, pas de transfert) | Limitée (transfert vers datacenters Anthropic/OpenAI) |
| Indépendance vis-à-vis de l'éditeur | Totale (poids ouverts, pas de licence révocable) | Aucune (licence révocable, rate-limit, désactivation possible) |
| Contrôle de la performance | Totale (calibrage matériel, runtime, configuration) | Limitée (API fermée, paramètres fixes) |
| Coût par token à mi-charge | Le plus bas à mi-charge (amorti) | Le plus bas à pleine charge (tarif public) |
| Conformité RGPD / HDS / SecNumCloud | Compatible par construction | Non compatible (transfert hors Union) |
| Risque de désactivation | Aucun (poids ouverts) | Présent (licence révocable) |
| Fine-tuning sur données métier | Possible (Unsloth, QLoRA) | Impossible (API fermée) |
| Latence P50 | ~30 ms, estimation sur cette configuration (pas de réseau) | latence réseau + rate-limit éditeur, valeur non publiée |
| Utilisateurs concurrents ctx 1M | 14 (calibrable) | Limité par l'API et les quotas éditeur |
Conclusion sur la souveraineté matérielle : le matériel local apporte la confidentialité totale des données (pas de transfert hors Union), l'indépendance complète vis-à-vis de l'éditeur (poids ouverts, pas de licence révocable, pas de rate-limit), et la maîtrise totale de la performance (calibrage matériel, runtime, configuration). Ces avantages n'ont pas de prix monétaire, mais ils sont décisifs pour les entreprises françaises et européennes qui ont des obligations de conformité RGPD, HDS et SecNumCloud, ou qui veulent éviter la dépendance à un fournisseur cloud étranger.
Conclusion : quel modèle pour quel cas d'usage
| Cas d'usage | Modèle recommandé | Justification |
|---|---|---|
| Agents de code, ingénierie logicielle | DeepSeek V4 Flash 0731 | 82,7 % sur Terminal Bench 2.1, 54,2 % sur NL2Repo, 54,4 % sur DeepSWE, 70,3 % sur Toolathlon-Verified, à 13 B de paramètres actifs. |
| Raisonnement général, précision | Claude Opus 5 | Les épreuves de connaissance et de raisonnement restent le terrain des modèles propriétaires ; leurs scores ne sont pas publiés sur ces mêmes benchmarks. |
| Chat généraliste, économique | DeepSeek API V4 Flash 0731 | Coût par token le plus bas à 0.21 $/M. Meilleur sur les benchmarks agentiques. |
| Données sensibles, RGPD, HDS, SecNumCloud | DeepSeek V4 Flash 0731 en local | Poids ouverts, exécution en local, pas de transfert hors Union, pas de rate-limit, pas de risque de désactivation. |
| Fine-tuning sur données métier | DeepSeek V4 Flash 0731 (Unsloth) | Poids ouverts, fine-tuning QLoRA possible avec Unsloth, lossless en quantization QAT-aware. |
| Latence critique, temps réel | DeepSeek V4 Flash 0731 sur DGX Station | Pas de latence réseau ni de rate-limit éditeur : le gain est structurel, pas lié au modèle. |
| Budget serré, faible volume | GPT-5.5 ou DeepSeek API | Coût par token le plus bas à 2.50 $/M et 0.21 $/M respectivement. Le local est rentable au-delà de 1.1 M tokens/jour. |
Évaluer votre déploiement DeepSeek V4 Flash 0731
Un échange sans engagement pour cadrer votre cas d'usage (agents de code, service client, documentation interne, raisonnement général), choisir entre DeepSeek V4 Flash 0731 en local, DeepSeek API, Claude Opus 5 et GPT-5.5, et valider la recette vLLM sur votre infrastructure.
Réserver un échangeRéférences
- DeepSeek V4 Flash 0731, dépôt officiel Hugging Face
- Rapport technique DeepSeek V4 (arXiv 2606.19348)
- Artificial Analysis Intelligence Index v4.1
- Claude Opus 5 pricing (Anthropic)
- OpenAI GPT-5.5 pricing
- Unsloth, documentation DeepSeek V4
- Fiche QDNA : DeepSeek V4
- Fiche QDNA : vLLM
- Fiche QDNA : DGX Station
Questions fréquentes
Quel modèle est le meilleur entre DeepSeek V4 Flash 0731, Claude Opus 5 et GPT-5.5 ?
Selon les benchmarks officiels, DeepSeek V4 Flash 0731 est fort sur les tâches agentiques et de code, Terminal Bench 2.1 à 82,7 %, Cybergym à 76,7 %, Toolathlon-Verified à 70,3 %, avec seulement 13 milliards de paramètres actifs. Il l'est moins sur les épreuves de connaissance et de raisonnement scientifique, MMLU-Pro à 86,6 % et GPQA Diamond à 74,9 %. C'est le profil attendu d'un modèle post-entraîné pour l'outillage plutôt que pour l'examen. Le choix dépend du cas d'usage : agentique et code = DeepSeek V4 Flash 0731, raisonnement général = Claude Opus 5 ou GPT-5.5.
Quel est le coût par token de DeepSeek V4 Flash 0731 en local vs Claude Opus 5 vs GPT-5.5 ?
DeepSeek V4 Flash 0731 en local sur DGX Station : 20 €/M tokens (amorti sur 3 ans). Claude Opus 5 : 15 $/M tokens (5 in + 25 out, mixe 50/50). GPT-5.5 : 2.50 $/M tokens (0.5 in + 2 out, mixe 50/50). DeepSeek API V4 Flash 0731 : 0.21 $/M tokens (0.14 in + 0.28 out, mixe 50/50). Le local est le plus cher à pleine charge mais le moins cher à mi-charge et le plus souverain.
DeepSeek V4 Flash 0731 est-il vraiment souverain ?
Oui. DeepSeek V4 Flash 0731 est un modèle à poids ouverts (licence MIT) que vous pouvez télécharger et exécuter sur votre propre matériel sans licence révocable, sans rate-limit éditeur, et sans transfert de données hors Union. Claude Opus 5 et GPT-5.5 sont des API fermées qui transfèrent les données vers les datacenters d'Anthropic et d'OpenAI respectivement.
Quelle est la différence entre DeepSeek V4 Flash 0731 et V4 Pro ?
V4 Flash 0731 est un MoE de 284 milliards de paramètres avec 13 milliards actifs par token, contexte 1M, et il dépasse V4 Pro (1.6T, 49B actifs) sur tous les benchmarks agentiques publiés par DeepSeek (Terminal Bench 2.1, NL2Repo, Cybergym, DeepSWE, Toolathlon). V4 Pro reste en preview et n'a pas reçu de révision 0731.
Comment déployer DeepSeek V4 Flash 0731 en local ?
Utilisez les GGUFs Unsloth Dynamic (UD-IQ3_XXS 104 Go recommandé pour 128 Go, UD-Q8_K_XL lossless 162 Go) avec vLLM 0.25+ ou Ollama. Pour un déploiement sur DGX Spark (128 Go) : docker pull nvcr.io/nvidia/vllm:25.04-py3-aarch64, puis vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 --trust-remote-code --kv-cache-dtype fp8 --enable-expert-parallel. Pour un cluster 2× Spark : relier les deux Spark par ConnectX-7 200 Gb/s et utiliser --tensor-parallel-size 2.