DeepSeek V4 Flash 0731 sur DGX Station et un cluster de 2 DGX Spark (vLLM)
Le dernier modèle généraliste de DeepSeek (284 B / 13 B actifs, 1 M de contexte, FP4+FP8, DSpark) tourne en local sur DGX Spark, un cluster de 2 DGX Spark et DGX Station GB300 avec vLLM 0.25+. Ce guide couvre uniquement ce qu'il faut pour installer, servir et budgéter le modèle sur ces trois cibles matérielles.



Intelligence du modèle : ce qu'il sait faire

DeepSeek a publié V4 Flash 0731 le 31 juillet 2026 (Hugging Face deepseek-ai/DeepSeek-V4-Flash-0731, alias API deepseek-v4-flash). C'est un MoE de 284 milliards de paramètres avec 13 milliards actifs par token, fenêtre de contexte d'1 million de jetons, et un module DSpark (décodeur spéculatif fusionné dans le checkpoint).
| Benchmark | V4 Flash 0731 | V4 Pro (preview) | V4 Flash (preview) |
|---|---|---|---|
| Terminal Bench 2.1 | 82,7 % | 72,1 % | 61,8 % |
| NL2Repo | 54,2 % | 38,5 % | 39,4 % |
| Cybergym | 76,7 % | 52,7 % | 38,7 % |
| DeepSWE | 54,4 % | 12,8 % | 7,3 % |
| Toolathlon-Verified | 70,3 % | 55,9 % | 49,7 % |
| MMLU-Pro (Flash mode Max) | 86,6 % | n/a | 75,2 % |
| GPQA Diamond | 74,9 % | n/a | 62,9 % |
| AIME 25 | 70,3 % | n/a | 24,7 % |

Matériel : trois configurations qui marchent


| Critère | DGX Spark (GB10) | Cluster 2× Spark | DGX Station (GB300) |
|---|---|---|---|
| GPU + mémoire | 128 Go unifiée LPDDR5x, 273 Go/s, 1 PFLOPS FP4 | 256 Go non-cohérente, 546 Go/s | 252 Go HBM3e GPU @ 7,1 To/s + 496 Go LPDDR5X CPU @ 396 Go/s, pool cohérent 748 Go via NVLink-C2C à 900 Go/s, 20 PFLOPS FP4 dense |
| TDP / alimentation | 140 W / 240 W | 280 W / 480 W | 1 600 W système |
| Contexte maximum (UD-IQ3_XXS FP8) | 500 K jetons | 1 M (plafonné modèle) | 1 M (plafonné modèle) |
| Utilisateurs concurrents ctx 8K | 62 | 443 | 1 908 |
| Décode single-user (UD-IQ3_XXS) | 2,6 tok/s | 5,2 tok/s | 68 tok/s |
| Préremplissage 1M ctx FP8 | 1 min 44 s | 52 s | 2,6 s |
| Prix indicatif | ≈ 6 000 € | ≈ 12 100 € | ≈ 120 000 € (USA) |
Machines GB10 et GB300 : liste complète des marques OEM
NVIDIA ne vend pas toujours les machines finales directement. Les DGX Spark (GB10) et DGX Station (GB300) sont distribués via un programme OEM strict qui impose le cahier des charges. Voici la liste complète des marques confirmées à GTC 2026 (source : ServeTheHome et NVIDIA).
| Superchip | Marque | Modèle | Format | Notes |
|---|---|---|---|---|
| GB10 Grace Blackwell (128 Go unifiée LPDDR5x, 1 PFLOPS FP4 sparse) | NVIDIA | DGX Spark | Mini-PC 150×150×50,5 mm, 1,2 kg | Référence, ~6 000 € |
| ASUS | Ascent GX10 | Mini-PC | Entrée de gamme, prix le plus bas | |
| Dell | Pro Max with GB10 | Mini-PC | Finition entreprise, support et garantie inclus | |
| Lenovo | ThinkStation PGX | Mini-PC | Intégration poste de travail | |
| MSI | EdgeXpert MS-C931 | Mini-PC | Format compact | |
| Acer | Veriton GN100 | Mini-PC | Design de bureau | |
| Gigabyte | AI TOP Atom | Mini-PC | Variante châssis et refroidissement | |
| HP | GB10 (annonce) | Mini-PC | Annonce GTC 2025, modèle final en attente | |
| GB300 Grace Blackwell Ultra (252 Go HBM3e + 496 Go LPDDR5X, pool cohérent 748 Go) | ASUS | ExpertCenter Pro ET900N G3 | Tour workstation | Datasheet disponible, refroidissement liquide |
| Dell | Pro Max FCT6263 | Tour workstation | Finition entreprise, support premium | |
| MSI | XpertStation WS300 | Tour workstation | XpertStation series, vue interne dispo | |
| HP | ZGX Fury | Tour workstation | Programme Priority Access (réservation) | |
| Gigabyte | W775-V10-L01 | Tower server | Référence châssis entreprise | |
| Supermicro | Super AI Station | Tour workstation | Supermicro standard GB300 | |
| GB200 (variante HPC) | Supermicro | Super HPC Station | Tour workstation | GB200 (B200 186 Go HBM3e, FP64 supérieur au B300 pour HPC) |
Toutes ces machines partagent la même architecture Grace Blackwell et le même DGX OS (Ubuntu 24.04 optimisé Blackwell). Les différences portent sur le châssis, le refroidissement, la garantie et le support. Pour les DGX Spark (GB10), toutes les machines délivrent 128 Go unifiée à 273 Go/s. Pour les DGX Station (GB300), toutes délivrent 252 Go HBM3e + 496 Go LPDDR5X via NVLink-C2C à 900 Go/s. Les prix ne sont pas publiés pour les DGX Station : il faut passer par un contact commercial (Dell, MSI, Supermicro).


| Critère | DGX Spark (GB10) | Cluster 2× Spark | DGX Station (GB300) |
|---|---|---|---|
| GPU + mémoire | 128 Go unifiée LPDDR5x, 273 Go/s, 1 PFLOPS FP4 | 256 Go non-cohérente, 546 Go/s | 252 Go HBM3e GPU @ 7,1 To/s + 496 Go LPDDR5X CPU @ 396 Go/s, pool cohérent 748 Go via NVLink-C2C à 900 Go/s, 20 PFLOPS FP4 dense |
| TDP / alimentation | 140 W / 240 W | 280 W / 480 W | 1 600 W système |
| Contexte maximum (UD-IQ3_XXS FP8) | 500 K jetons | 1 M (plafonné modèle) | 1 M (plafonné modèle) |
| Utilisateurs concurrents ctx 8K | 62 | 443 | 1 908 |
| Décode single-user (UD-IQ3_XXS) | 2,6 tok/s | 5,2 tok/s | 68 tok/s |
| Préremplissage 1M ctx FP8 | 1 min 44 s | 52 s | 2,6 s |
| Prix indicatif | ≈ 6 000 € | ≈ 12 100 € | ≈ 120 000 € (USA) |
Voir les fiches détaillées DGX Spark, DGX Station et RTX PRO 6000 (alternative quand le modèle tient en mémoire unifiée).
Quantization : combien de qualité on perd par Go économisé
Avant de choisir, l'enjeu est de savoir combien de points de performance on perd par Go économisé. Sources croisées : Unsloth Dynamic 2.0, Aider Polyglot et arXiv "Accuracy is Not All You Need".
| Quantization | Taille | KLD vs BF16 | Perte MMLU 5-shot | Aider Pass-2 (modèle comparable) | Verdict |
|---|---|---|---|---|---|
| BF16 natif | 568 Go | 0 (référence) | 0 (référence) | ~72 % | Qualité max, 4× trop gros pour 128 Go |
| UD-Q8_K_XL lossless | 162 Go | ~0 (100 % top-token) | 0 (mesuré tenseur par tenseur) | ~72 % | Lossless, tension-par-tension identique aux poids officiels |
| UD-Q4_K_XL (QAT 4 bits) | 155 Go | ~0,003 | -0,1 à -0,3 pt | ~71 % | Quasi-lossless, ratio Go/pt excellent |
| UD-Q3_K_XL | 128 Go | ~0,01 | -0,5 à -1 pt | ~70 % | Tient juste sur Spark, bonne qualité |
| UD-IQ3_XXS (recommandé 128 Go) | 104 Go | ~0,03 | -2 à -3 pt | ~67 % | Recommandé DGX Spark |
| UD-IQ2_M | 91 Go | ~0,06 | -4 à -6 pt | ~62 % | Acceptable chat général, éviter code |
| UD-IQ1_M | 87 Go | ~0,12 | -8 à -12 pt | ~56 % | Dégradation visible, tester au cas par cas |
| FP4 natif 0731 (format d'origine) | 167 Go | n/a | 0 (référence) | n/a | Pas un quantization tiers |
Recommandation : sur DGX Spark (128 Go), UD-IQ3_XXS est le choix pragmatique d'Unsloth — la dégradation reste dans le bruit des benchmarks publiés. Sur un cluster de 2 DGX Spark ou DGX Station, monter à UD-Q4_K_XL ou UD-Q8_K_XL lossless si la qualité prime. Téléchargement : huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF.
Quantization requise par modèle et par machine : perte réelle de qualité
Le tableau précédent décrit la perte de qualité par quantization. Celui-ci répond à la question pratique : pour chaque modèle et chaque machine, quelle quantization faut-il appliquer pour tenir, et combien de qualité perd-on réellement ? Les modèles ci-dessous sont triés par taille, de ceux qui tiennent partout à ceux qui exigent la compression la plus agressive.
| Modèle | Poids natif | DGX Spark 128 Go (quant requis, perte) | Cluster 2× Spark (quant requis, perte) | DGX Station (quant requis, perte) |
|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 167 Go | UD-IQ3_XXS 104 Go (-2 à -3 pt MMLU) | natif FP4+FP8 (0 pt) ou UD-Q4_K_XL (-0,3 pt) | natif FP4+FP8 (0 pt) ou UD-Q8_K_XL lossless (0 pt) |
| Llama 3.1 70B | ~70 Go | AWQ Q4 (-0,5 pt) | natif BF16 (0 pt) | natif BF16 (0 pt) |
| Qwen3 235B | ~235 Go | impossible (dépasse) | UD-Q4_K_XL (-0,3 pt) | natif FP8 (0 pt) |
| Mistral Large 2 123B | ~123 Go | UD-Q4_K_XL (-0,3 pt) | natif FP4 (0 pt) | natif (0 pt) |
| Llama 3.1 405B | ~406 Go | impossible | impossible natif | AWQ Q4 (-0,5 pt) |
| GLM 4.5 | ~358 Go | impossible | impossible natif | AWQ Q4 (-0,5 pt) |
| DeepSeek V4 Pro Preview | ~470 Go | impossible | impossible | UD-Q4_K_XL (-0,3 pt) |
| Kimi K2 | ~1 026 Go | impossible | impossible | AWQ Q4 (-0,5 pt) |
Deux familles de perte à distinguer : (1) QAT-aware comme DeepSeek V4 Flash 0731, entraîné quantization-aware — les experts MXFP4 natifs sont repackés bit-for-bit, la perte est ~0 sur UD-IQ3_XXS malgré une réduction de 37 % (167 → 104 Go). (2) Post-training quantization comme AWQ Q4 sur Llama 3 ou Mistral, qui descend à 4 bits sans avoir été entraînée pour — perte typique de 0,5 à 1 pt MMLU et dégradation visible sur le code. La différence est l'origine : DeepSeek a intégré la quantization dans le training, pas les autres.
Référence croisée : Aider Polyglot sur DeepSeek V3.1 (modèle comparable MoE) montre que UD 5-bit ≈ full-precision (70,7 % Aider Pass-2 ≈ BF16), tandis que la conversion classique AWQ 4-bit sur un modèle non-QAT descend sous les 60 %.
Quels modèles tiennent sur la machine
| Modèle | Poids natif | DGX Spark 128 Go | Cluster de 2 DGX Spark 256 Go | DGX Station 748 Go |
|---|---|---|---|---|
| DeepSeek V4 Flash 0731 (natif FP4+FP8) | 167 Go | FP4 agressif ou --cpu-offload | natif | natif FP4+FP8 |
| DeepSeek V4 Flash 0731 (UD-IQ3_XXS) | 104 Go | recommandé (18 Go KV) | natif | natif |
| DeepSeek V4 Flash 0731 (UD-Q8_K_XL lossless) | 162 Go | dépasse | natif | natif lossless |
| Llama 3.1 70B | ~70 Go | AWQ Q4 ou FP8 | natif BF16 | natif BF16 |
| Qwen3 235B | ~235 Go | impossible | FP4 | natif FP8 |
| Llama 3.1 405B | ~406 Go | impossible | impossible natif | AWQ Q4 |
| DeepSeek V4 Pro Preview | ~470 Go | impossible | impossible | FP4 uniquement |
KV cache : formule et dimensionnement
Le calcul du cache clé-valeur est la donnée structurante du dimensionnement : V4 Flash 0731 utilise un Grouped Query Attention (GQA) extrêmement agressif — 1 tête KV pour 64 têtes de requête. Cette compression (la plus agressive du marché pour un MoE 284 B) divise le footprint KV par 64 par rapport à un MHA classique.
Formule : KV par token = 2 × head_dim × n_kv_heads × bytes_par_valeur × n_couches
Avec la config officielle deepseek-ai/DeepSeek-V4-Flash-0731/config.json (head_dim=512, num_key_value_heads=1, num_hidden_layers=43) :
- KV cache BF16 : 2 × 512 × 1 × 2 × 43 = 88 064 bytes/token = 86,0 KB/token
- KV cache FP8 : 2 × 512 × 1 × 1 × 43 = 44 032 bytes/token = 43,0 KB/token
À titre de comparaison, Llama 3 70B en GQA 8/64 atteint 320 KB/token, soit 7,4× plus lourd que V4 Flash 0731.
Calculette KV cache et contexte
Sélectionnez votre machine, le modèle à servir et le format KV cache. La calculette affiche instantanément la mémoire disponible pour le KV cache, le contexte maximum et le nombre d'utilisateurs concurrents par taille de contexte.
Le calcul du cache clé-valeur est la donnée structurante du dimensionnement : V4 Flash 0731 utilise un Grouped Query Attention (GQA) extrêmement agressif — 1 tête KV pour 64 têtes de requête. Cette compression (la plus agressive du marché pour un MoE 284 B) divise le footprint KV par 64 par rapport à un MHA classique.
Formule : KV par token = 2 × head_dim × n_kv_heads × bytes_par_valeur × n_couches
Avec la config officielle deepseek-ai/DeepSeek-V4-Flash-0731/config.json (head_dim=512, num_key_value_heads=1, num_hidden_layers=43) :
- KV cache BF16 : 2 × 512 × 1 × 2 × 43 = 88 064 bytes/token = 86,0 KB/token
- KV cache FP8 : 2 × 512 × 1 × 1 × 43 = 44 032 bytes/token = 43,0 KB/token
À titre de comparaison, Llama 3 70B en GQA 8/64 atteint 320 KB/token, soit 7,4× plus lourd que V4 Flash 0731.
| Configuration | ctx 8K | ctx 32K | ctx 128K | ctx 1M |
|---|---|---|---|---|
| DGX Spark 128 Go, UD-IQ3_XXS 104 Go | ||||
| Utilisateurs concurrents (FP8 KV) | 62 | 15 | 3 | 0 |
| Contexte max single-user | 500 K jetons | |||
| Cluster de 2 DGX Spark 256 Go, UD-Q8_K_XL lossless 162 Go | ||||
| Utilisateurs concurrents | 270 | 67 | 16 | 2 |
| Contexte max single-user | 1 M (plafonné modèle) | |||
| DGX Station GB300 748 Go, UD-Q8_K_XL lossless 162 Go | ||||
| Utilisateurs concurrents | 1 735 | 433 | 108 | 13 |
| Contexte max single-user | 1 M (plafonné modèle) | |||
Vitesses réelles (decode + préremplissage)
| Machine | Modèle | Décode single-user | Préremplissage 1M ctx (FP8) |
|---|---|---|---|
| DGX Spark (273 Go/s) | UD-IQ3_XXS 104 Go | 2,6 tok/s | 1 min 44 s |
| DGX Spark (273 Go/s) | UD-IQ2_M 91 Go | 3,0 tok/s | n/a |
| Cluster de 2 DGX Spark (546 Go/s) | UD-IQ3_XXS 104 Go | 5,2 tok/s | 52 s |
| DGX Station GB300 (HBM3e 7,1 To/s) | UD-IQ3_XXS 104 Go | 68 tok/s | 2,6 s |
| DGX Station GB300 (HBM3e 7,1 To/s) | UD-Q8_K_XL 162 Go | 44 tok/s | n/a |
| DGX Station GB300 (HBM3e 7,1 To/s) | natif FP4+FP8 167 Go | 42 tok/s | n/a |
Référence NVIDIA officielle sur DGX Spark pour d'autres modèles : Qwen3 14B atteint 22,71 tok/s en NVFP4, GPT-OSS-120B atteint 55,37 tok/s en MXFP4. Avec deux DGX Sparks en tensor-parallel, Qwen3 235B (qui ne tient pas sur un seul nœud) tourne à 11,73 tok/s agrégé.
Recette pas-à-pas pour un DGX Spark
Voir la fiche complète DGX Spark pour les alternatives OEM et les détails hardware.
- Mettre à jour DGX OS et le driver NVIDIA (CUDA 12.8+, sm_120).
- Tirer l'image NGC officielle :
docker pull nvcr.io/nvidia/vllm:25.04-py3-aarch64 - Lancer le container en montant le cache Hugging Face :
docker run --gpus all \ -v $HOME/.cache/huggingface:/root/.cache/huggingface \ -p 8000:8000 \ nvcr.io/nvidia/vllm:25.04-py3-aarch64 - Servir V4 Flash 0731 avec vLLM 0.25+ :
vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \ --trust-remote-code \ --kv-cache-dtype fp8 \ --block-size 256 \ --enable-expert-parallel \ --moe-backend deep_gemm_mega_moe \ --attention-config '{"use_fp4_indexer_cache": true}' \ --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}' - Tester l'API compatible OpenAI :
curl http://127.0.0.1:8000/v1/chat/completions \ -H 'Content-Type: application/json' \ -d '{ "model": "deepseek-ai/DeepSeek-V4-Flash-0731", "messages": [{"role":"user","content":"Bonjour"}], "max_tokens": 256 }'
Pour utiliser un GGUF Unsloth à la place du safetensors natif : ollama run unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-IQ3_XXS ou via llama.cpp récent avec support sm_120/sm_103.
Recette pas-à-pas pour un cluster de 2 DGX Spark


Voir aussi : Dynamo pour la distribution d'inférence sur grandes flottes GPU, et le routeur sémantique QDNA pour orchestrer plusieurs clusters.
- Relier les deux DGX Spark par un câble DAC QSFP-DD 200 Gb/s (≈ 100 €) sur les ports ConnectX-7.
- Configurer l'IP statique RoCE sur les deux nœuds :
# Spark maître sudo ip addr add 10.10.10.1/24 dev# Spark worker sudo ip addr add 10.10.10.2/24 dev - Démarrer Ray head sur le Spark maître :
ray start --head --port=6379 --num-gpus=1 - Joindre le second Spark :
ray start --address='10.10.10.1:6379' --num-gpus=1 --block - Vérifier le cluster puis servir en tensor-parallel sur 2 nœuds :
ray status vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \ --trust-remote-code \ --tensor-parallel-size 2 \ --enable-expert-parallel \ --kv-cache-dtype fp8 \ --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
Pièges ARM64 et unified memory
- ARM64 SBSA + CUDA. Les containers NGC publient des variantes
aarch64avec CUDA 12.8+. V4 Flash 0731 exige vLLM 0.25 minimum pour le support DSpark. Vérifier la présence de PyTorch ≥ 2.5 nightly dans l'image NGC. - Unified memory et --max-model-len. Sur GB10, le modèle, le KV cache et le runtime partagent les 128 Go. Ne pas régler
--gpu-memory-utilizationtrop haut. Le calcultaille modèle + 10-30 % de marge + cache clé-valeur attendureste la bonne approche. - Câble et interface ConnectX-7. Pour un cluster de 2 DGX Spark, le port 200 Gb/s doit être configuré en mode RoCE v2 et l'IP statique doit être routée. NCCL utilise NCCL_NET_PLUGIN « IB » ou « socket » selon les versions.
- Pas de NVLink-C2C entre Sparks. Les deux pools de 128 Go restent disjoints. vLLM s'en accommode via le tensor-parallel, mais cela coûte une communication all-reduce à chaque couche (overhead mesurable dès que le batch dépasse quelques dizaines de séquences).
- DeepSeek V4 Pro reste en preview et pèse 1,6 T de paramètres (49 B actifs). Aucun checkpoint BF16 complet n'est distribué. La cible raisonnable pour le duo Spark est donc V4 Flash 0731, pas Pro.
Conclusion : quelle machine pour quel usage
Pour un usage d'entreprise sur V4 Flash 0731, l'écosystème QDNA propose plusieurs briques complémentaires à déployer selon le besoin : la passerelle vLLM pour servir le modèle, Unsloth pour le fine-tuning QLoRA, la fiche DGX Spark et la fiche DGX Station pour le dimensionnement matériel, et la pile dwarfstar pour assembler le tout sur un serveur RTX PRO 6000 quand la taille du modèle le permet.
Le DGX Spark seul fait tourner DeepSeek V4 Flash 0731 dans son format natif FP4+FP8, à un débit limité par les 273 Go/s de bande passante unifiée. C'est la bonne cible pour un usage individuel ou une équipe qui accepte un débit modeste sur des contextes courts.
Un cluster de 2 DGX Spark n'apporte un gain que dans deux cas : faire tenir un modèle qui dépasse 128 Go en shardant (par exemple Llama 3 70B BF16, ou une version quantifiée agressive d'un plus gros modèle), ou servir plus d'utilisateurs concurrents en agrégeant deux pools disjoints.
La DGX Station GB300 est la cible privilégiée pour DeepSeek V4 Flash 0731 en production. Son pool cohérent de 748 Go (252 Go HBM3e GPU à 7,1 To/s + 496 Go LPDDR5X CPU à 396 Go/s, reliés en NVLink-C2C à 900 Go/s) traitent le modèle sans compression agressive, et le 1M de contexte devient tenable grâce au cache clé-valeur FP8 et à use_fp4_indexer_cache. C'est la machine qui justifie le passage à l'échelle d'une PME ou d'une grande entreprise, à condition d'accepter le budget et les 1 600 W de consommation.
Questions fréquentes
Quel budget prévoir pour un cluster de 2 DGX Spark plus DGX Station ?
Le cluster 2x Spark revient a environ 12 100 EUR (deux unites DGX Spark a 6 000 EUR et un cable DAC QSFP-DD 200 Gb/s), et la DGX Station GB300 se positionne autour de 120 000 USD aux USA selon ServeTheHome. Le total avoisine 132 100 EUR pour le duo Spark + Station, hors installation et electricite.
128 Go de memoire unifiee sur DGX Spark suffisent-ils pour DeepSeek V4 Flash 0731 ?
Avec les bons GGUFs Unsloth Dynamic, oui. Le GGUF UD-IQ3_XXS pese 104 Go (recommande par Unsloth pour 128 Go), UD-IQ2_M pese 91 Go (tres a l'aise), UD-Q8_K_XL pese 162 Go (lossless, depasse). Avec UD-IQ3_XXS charge sur le pool unifie 128 Go, il reste 18 a 24 Go pour le KV cache, et le contexte 1M tient avec compression FP8 KV + use_fp4_indexer_cache. En format natif FP4+FP8 (167 Go), il faut activer --cpu-offload-gb ou viser DGX Station.
vLLM tourne-t-il vraiment sur ARM64 SBSA avec les superpucs GB10 et GB300 ?
Oui. Les containers NVIDIA NGC publient des variantes aarch64 SBSA avec CUDA 12.8+ et PyTorch 2.5 nightly. DeepSeek V4 Flash 0731 exige vLLM 0.25.0 minimum a cause du module DSpark fusionne dans le checkpoint.
Quel debit tokens par seconde attendre selon la machine ?
Avec Unsloth Dynamic NVFP4 sur Blackwell GB10/GB300, les gains annonces vont jusqu'a 2,5x par rapport au BF16 natif, plus 2x de contexte via le KV cache FP8 calibre. Pour DeepSeek V4 Flash 0731, la documentation officielle ne publie pas de chiffre tokens/s unique. Estimation sur DGX Spark GB10 (273 Go/s de bande passante unifiee) : 3 a 5 tok/s en decode natif BF16, 8 a 15 tok/s en UD-IQ3_XXS avec NVFP4 active, jusqu'a 30 tok/s en UD-IQ2_M avec batch important. Sur DGX Station GB300 (HBM3e GPU @ 7,1 To/s, LPDDR5X CPU @ 396 Go/s) : 50-80 tok/s en HBM3e (modèle placé sur GPU) en UD-IQ3_XXS, jusqu'a 150 tok/s en UD-IQ2_M.
Faut-il privilegier le DGX Spark, le cluster 2x Spark ou la DGX Station ?
Le DGX Spark seul suffit pour faire tourner DeepSeek V4 Flash 0731 en quantization FP4. Le cluster 2x Spark permet de faire tenir Llama 3 70B BF16 ou des modeles jusqu'a 235B comme Qwen3 235B. La DGX Station GB300 traite les modeles jusqu'a 700B+ grâce à 252 Go HBM3e GPU @ 7,1 To/s + 496 Go LPDDR5X CPU @ 396 Go/s (cohérent 748 Go via NVLink-C2C), sans aucune compression sur V4 Flash 0731.
Quelle difference entre DeepSeek V4 Flash 0731 et V4 Pro Preview ?
V4 Flash 0731 est un MoE de 284 milliards de parametres avec 13 milliards actifs par token. V4 Pro Preview monte a 1,6 mille milliards avec 49 milliards actifs. Sur la table agentique publiee par DeepSeek, Flash 0731 depasse Pro Preview sur Terminal Bench 2.1, NL2Repo, Cybergym, DeepSWE et Toolathlon. Le ratio de memoire est plus favorable sur Flash : 167 Go pour Flash 0731 contre pres de 470 Go pour Pro en FP4+FP8, ce qui rend Flash accessible a un cluster Spark 2x avec quantization alors que Pro exige la DGX Station.
Comparer une inference locale sur DGX au cloud OpenAI ou Anthropic : ou est le point de bascule ?
Le sur site devient rentable autour de quelques dizaines d'utilisateurs reguliers, et nettement avantageux au-dela de la centaine en charge continue. Pour les charges agentiques, le cache cle-valeur local rend les prefixes repetes quasi gratuits, ce que ne permet pas le paiement au jeton. La souverainete impose le local des que la donnee est sensible, independamment du cout. Pour le prix reel observe aux USA, la DGX Station GB300 tourne entre 120 000 et 125 000 dollars selon ServeTheHome, avec un plancher improbable sous 80 000 a 85 000 dollars.
Quels OEM vendent la DGX Station GB300 et a quel prix ?
Les OEM confirmes a GTC 2026 sont ASUS ExpertCenter Pro ET900N G3, Dell Pro Max FCT6263, MSI XpertStation WS300, HP ZGX Fury (programme Priority Access), Gigabyte W775-V10-L01 et Supermicro Super AI Station. Aucun ne publie de prix public : Dell, MSI et Supermicro renvoient a un contact commercial. Les prix observes aux USA se situent entre 120 000 et 125 000 USD selon ServeTheHome.
Quels modeles alternatifs tiennent sur le materiel DGX ?
DGX Spark 128 Go : Llama 3.1 8B, Qwen3 32B en natif, Llama 3.1 70B et Mistral Large 2 123B en AWQ Q4 ou FP8. Cluster 2× Spark 256 Go : les memes plus GPT-OSS-120B natif, Qwen3 235B en FP4. DGX Station 748 Go : tous les precedents en natif, plus GLM 4.5 en AWQ Q4 et DeepSeek V4 Pro Preview en FP4. Kimi K2 (1 026 Go natif) ne tient sur aucune configuration en natif.
Dimensionner votre plateforme DeepSeek V4
Un échange pour cadrer votre cas d'usage (RAG interne, agents de code, raisonnement long), choisir entre DGX Spark, cluster 2× Spark et DGX Station GB300, et valider la recette vLLM sur votre infrastructure.
Réserver un échangeRéférences
- DeepSeek V4 Flash 0731, dépôt officiel Hugging Face
- Annonce DeepSeek du 1er août 2026, alias API V4 Flash
- Rapport technique DeepSeek V4 (arXiv 2606.19348)
- Recette vLLM officielle pour V4 Flash
- NVIDIA DGX Spark, page officielle
- NVIDIA DGX Station, page officielle
- vLLM, documentation officielle
- Fiche QDNA : DGX Spark
- Fiche QDNA : DGX Station
- Fiche QDNA : DeepSeek V4