QDNAVente et intégration de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

DeepSeek V4 Flash 0731 sur DGX Station et un cluster de 2 DGX Spark (vLLM)

Le dernier modèle généraliste de DeepSeek (284 B / 13 B actifs, 1 M de contexte, FP4+FP8, DSpark) tourne en local sur DGX Spark, un cluster de 2 DGX Spark et DGX Station GB300 avec vLLM 0.25+. Ce guide couvre uniquement ce qu'il faut pour installer, servir et budgéter le modèle sur ces trois cibles matérielles.

Bannière hero : bannière DeepSeek V4 Flash 0731 servie par vLLM sur un cluster DGX Spark 2× relié à une DGX Station GB300 Grace Blackwell Ultra, avec en arrière-plan le superchip GB10 et la mémoire unifiée 748 Go cohérente via NVLink-C2C.
Schéma de répartition mémoire du cluster 2× DGX Spark relié par ConnectX-7 200 Gb/s en RDMA/RoCE v2 : 2 nœuds de 128 Go unifiée LPDDR5x chacun. En tensor-parallel natif, V4 Flash 0731 est shardé ~83 Go par Spark. Le KV cache FP8 est réparti entre les 2 pools.
Schéma de répartition mémoire du cluster 2× DGX Spark relié par ConnectX-7 200 Gb/s en RDMA/RoCE v2 : 2 nœuds de 128 Go unifiée LPDDR5x chacun. En tensor-parallel natif, V4 Flash 0731 est shardé ~83 Go par Spark. Le KV cache FP8 est réparti entre les 2 pools.
Bannière hero : bannière DeepSeek V4 Flash 0731 servie par vLLM sur un cluster DGX Spark 2× relié à une DGX Station GB300 Grace Blackwell Ultra, avec en arrière-plan le superchip GB10 et la mémoire unifiée 748 Go cohérente via NVLink-C2C.
Bannière hero : bannière DeepSeek V4 Flash 0731 servie par vLLM sur un cluster DGX Spark 2× relié à une DGX Station GB300 Grace Blackwell Ultra, avec en arrière-plan le superchip GB10 et la mémoire unifiée 748 Go cohérente via NVLink-C2C.
Réponse courte. V4 Flash 0731 fait 167 Go en format natif FP4+FP8, ou 104 Go en GGUF Unsloth Dynamic UD-IQ3_XXS (recommandé pour 128 Go). Sur DGX Spark GB10 (128 Go LPDDR5x unifiée) : ~3 tok/s en natif, ~6-15 tok/s avec Unsloth NVFP4. Sur DGX Station GB300 (HBM3e GPU 7,1 To/s) : 50-80 tok/s. Voir le tableau matériel et les vitesses réelles.

Intelligence du modèle : ce qu'il sait faire

Logo officiel DeepSeek

DeepSeek a publié V4 Flash 0731 le 31 juillet 2026 (Hugging Face deepseek-ai/DeepSeek-V4-Flash-0731, alias API deepseek-v4-flash). C'est un MoE de 284 milliards de paramètres avec 13 milliards actifs par token, fenêtre de contexte d'1 million de jetons, et un module DSpark (décodeur spéculatif fusionné dans le checkpoint).

BenchmarkV4 Flash 0731V4 Pro (preview)V4 Flash (preview)
Terminal Bench 2.182,7 %72,1 %61,8 %
NL2Repo54,2 %38,5 %39,4 %
Cybergym76,7 %52,7 %38,7 %
DeepSWE54,4 %12,8 %7,3 %
Toolathlon-Verified70,3 %55,9 %49,7 %
MMLU-Pro (Flash mode Max)86,6 %n/a75,2 %
GPQA Diamond74,9 %n/a62,9 %
AIME 2570,3 %n/a24,7 %
Tableau matériel : DGX Spark GB10 (128 Go LPDDR5x unifiée, 273 Go/s), cluster 2× DGX Spark (256 Go non-cohérente, 546 Go/s) et DGX Station GB300 (252 Go HBM3e GPU @ 7,1 To/s + 496 Go LPDDR5X CPU @ 396 Go/s, pool cohérent 748 Go via NVLink-C2C à 900 Go/s, 20 PFLOPS FP4 dense).
Tableau matériel : DGX Spark GB10 (128 Go LPDDR5x unifiée, 273 Go/s), cluster 2× DGX Spark (256 Go non-cohérente, 546 Go/s) et DGX Station GB300 (252 Go HBM3e GPU @ 7,1 To/s + 496 Go LPDDR5X CPU @ 396 Go/s, pool cohérent 748 Go via NVLink-C2C à 900 Go/s, 20 PFLOPS FP4 dense).

Matériel : trois configurations qui marchent

Schéma de répartition mémoire de la DGX Station GB300 : pool cohérent 748 Go via NVLink-C2C à 900 Go/s, décomposé en 252 Go HBM3e GPU à 7,1 To/s (modèle et KV cache actif) et 496 Go LPDDR5X CPU à 396 Go/s (buffer CPU, swap, offload). ConnectX-8 800 Gb/s en lien externe.Schéma de répartition mémoire de la DGX Station GB300 : pool cohérent 748 Go via NVLink-C2C à 900 Go/s, décomposé en 252 Go HBM3e GPU à 7,1 To/s (modèle et KV cache actif) et 496 Go LPDDR5X CPU à 396 Go/s (buffer CPU, swap, offload). ConnectX-8 800 Gb/s en lien externe.
Allocation mémoire de la DGX Station GB300 : 252 Go HBM3e GPU à 7,1 To/s (perf) + 496 Go LPDDR5X CPU à 396 Go/s (capacité), réunis en pool cohérent 748 Go via NVLink-C2C à 900 Go/s. La LPDDR5X (496 Go) sert d'extension éventuelle, d'offload CPU si besoin, ou de swap. Le downgrade B300 (252/7,1 To/s vs 288/8 To/s annoncés à GTC 2025) est documenté par ServeTheHome.
CritèreDGX Spark (GB10)Cluster 2× SparkDGX Station (GB300)
GPU + mémoire128 Go unifiée LPDDR5x, 273 Go/s, 1 PFLOPS FP4256 Go non-cohérente, 546 Go/s252 Go HBM3e GPU @ 7,1 To/s + 496 Go LPDDR5X CPU @ 396 Go/s, pool cohérent 748 Go via NVLink-C2C à 900 Go/s, 20 PFLOPS FP4 dense
TDP / alimentation140 W / 240 W280 W / 480 W1 600 W système
Contexte maximum (UD-IQ3_XXS FP8)500 K jetons1 M (plafonné modèle)1 M (plafonné modèle)
Utilisateurs concurrents ctx 8K624431 908
Décode single-user (UD-IQ3_XXS)2,6 tok/s5,2 tok/s68 tok/s
Préremplissage 1M ctx FP81 min 44 s52 s2,6 s
Prix indicatif≈ 6 000 €≈ 12 100 €≈ 120 000 € (USA)

Machines GB10 et GB300 : liste complète des marques OEM

NVIDIA ne vend pas toujours les machines finales directement. Les DGX Spark (GB10) et DGX Station (GB300) sont distribués via un programme OEM strict qui impose le cahier des charges. Voici la liste complète des marques confirmées à GTC 2026 (source : ServeTheHome et NVIDIA).

SuperchipMarqueModèleFormatNotes
GB10 Grace Blackwell (128 Go unifiée LPDDR5x, 1 PFLOPS FP4 sparse)NVIDIADGX SparkMini-PC 150×150×50,5 mm, 1,2 kgRéférence, ~6 000 €
ASUSAscent GX10Mini-PCEntrée de gamme, prix le plus bas
DellPro Max with GB10Mini-PCFinition entreprise, support et garantie inclus
LenovoThinkStation PGXMini-PCIntégration poste de travail
MSIEdgeXpert MS-C931Mini-PCFormat compact
AcerVeriton GN100Mini-PCDesign de bureau
GigabyteAI TOP AtomMini-PCVariante châssis et refroidissement
HPGB10 (annonce)Mini-PCAnnonce GTC 2025, modèle final en attente
GB300 Grace Blackwell Ultra (252 Go HBM3e + 496 Go LPDDR5X, pool cohérent 748 Go)ASUSExpertCenter Pro ET900N G3Tour workstationDatasheet disponible, refroidissement liquide
DellPro Max FCT6263Tour workstationFinition entreprise, support premium
MSIXpertStation WS300Tour workstationXpertStation series, vue interne dispo
HPZGX FuryTour workstationProgramme Priority Access (réservation)
GigabyteW775-V10-L01Tower serverRéférence châssis entreprise
SupermicroSuper AI StationTour workstationSupermicro standard GB300
GB200 (variante HPC)SupermicroSuper HPC StationTour workstationGB200 (B200 186 Go HBM3e, FP64 supérieur au B300 pour HPC)

Toutes ces machines partagent la même architecture Grace Blackwell et le même DGX OS (Ubuntu 24.04 optimisé Blackwell). Les différences portent sur le châssis, le refroidissement, la garantie et le support. Pour les DGX Spark (GB10), toutes les machines délivrent 128 Go unifiée à 273 Go/s. Pour les DGX Station (GB300), toutes délivrent 252 Go HBM3e + 496 Go LPDDR5X via NVLink-C2C à 900 Go/s. Les prix ne sont pas publiés pour les DGX Station : il faut passer par un contact commercial (Dell, MSI, Supermicro).

Schéma de répartition mémoire de la DGX Station GB300 : pool cohérent 748 Go via NVLink-C2C à 900 Go/s, décomposé en 252 Go HBM3e GPU à 7,1 To/s (modèle et KV cache actif) et 496 Go LPDDR5X CPU à 396 Go/s (buffer CPU, swap, offload). ConnectX-8 800 Gb/s en lien externe.Schéma de répartition mémoire de la DGX Station GB300 : pool cohérent 748 Go via NVLink-C2C à 900 Go/s, décomposé en 252 Go HBM3e GPU à 7,1 To/s (modèle et KV cache actif) et 496 Go LPDDR5X CPU à 396 Go/s (buffer CPU, swap, offload). ConnectX-8 800 Gb/s en lien externe.
Allocation mémoire de la DGX Station GB300 : 252 Go HBM3e GPU à 7,1 To/s (perf) + 496 Go LPDDR5X CPU à 396 Go/s (capacité), réunis en pool cohérent 748 Go via NVLink-C2C à 900 Go/s. La LPDDR5X (496 Go) sert d'extension éventuelle, d'offload CPU si besoin, ou de swap. Le downgrade B300 (252/7,1 To/s vs 288/8 To/s annoncés à GTC 2025) est documenté par ServeTheHome.
CritèreDGX Spark (GB10)Cluster 2× SparkDGX Station (GB300)
GPU + mémoire128 Go unifiée LPDDR5x, 273 Go/s, 1 PFLOPS FP4256 Go non-cohérente, 546 Go/s252 Go HBM3e GPU @ 7,1 To/s + 496 Go LPDDR5X CPU @ 396 Go/s, pool cohérent 748 Go via NVLink-C2C à 900 Go/s, 20 PFLOPS FP4 dense
TDP / alimentation140 W / 240 W280 W / 480 W1 600 W système
Contexte maximum (UD-IQ3_XXS FP8)500 K jetons1 M (plafonné modèle)1 M (plafonné modèle)
Utilisateurs concurrents ctx 8K624431 908
Décode single-user (UD-IQ3_XXS)2,6 tok/s5,2 tok/s68 tok/s
Préremplissage 1M ctx FP81 min 44 s52 s2,6 s
Prix indicatif≈ 6 000 €≈ 12 100 €≈ 120 000 € (USA)

Voir les fiches détaillées DGX Spark, DGX Station et RTX PRO 6000 (alternative quand le modèle tient en mémoire unifiée).

Quantization : combien de qualité on perd par Go économisé

Avant de choisir, l'enjeu est de savoir combien de points de performance on perd par Go économisé. Sources croisées : Unsloth Dynamic 2.0, Aider Polyglot et arXiv "Accuracy is Not All You Need".

QuantizationTailleKLD vs BF16Perte MMLU 5-shotAider Pass-2 (modèle comparable)Verdict
BF16 natif568 Go0 (référence)0 (référence)~72 %Qualité max, 4× trop gros pour 128 Go
UD-Q8_K_XL lossless162 Go~0 (100 % top-token)0 (mesuré tenseur par tenseur)~72 %Lossless, tension-par-tension identique aux poids officiels
UD-Q4_K_XL (QAT 4 bits)155 Go~0,003-0,1 à -0,3 pt~71 %Quasi-lossless, ratio Go/pt excellent
UD-Q3_K_XL128 Go~0,01-0,5 à -1 pt~70 %Tient juste sur Spark, bonne qualité
UD-IQ3_XXS (recommandé 128 Go)104 Go~0,03-2 à -3 pt~67 %Recommandé DGX Spark
UD-IQ2_M91 Go~0,06-4 à -6 pt~62 %Acceptable chat général, éviter code
UD-IQ1_M87 Go~0,12-8 à -12 pt~56 %Dégradation visible, tester au cas par cas
FP4 natif 0731 (format d'origine)167 Gon/a0 (référence)n/aPas un quantization tiers

Recommandation : sur DGX Spark (128 Go), UD-IQ3_XXS est le choix pragmatique d'Unsloth — la dégradation reste dans le bruit des benchmarks publiés. Sur un cluster de 2 DGX Spark ou DGX Station, monter à UD-Q4_K_XL ou UD-Q8_K_XL lossless si la qualité prime. Téléchargement : huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF.

Quantization requise par modèle et par machine : perte réelle de qualité

Le tableau précédent décrit la perte de qualité par quantization. Celui-ci répond à la question pratique : pour chaque modèle et chaque machine, quelle quantization faut-il appliquer pour tenir, et combien de qualité perd-on réellement ? Les modèles ci-dessous sont triés par taille, de ceux qui tiennent partout à ceux qui exigent la compression la plus agressive.

ModèlePoids natifDGX Spark 128 Go (quant requis, perte)Cluster 2× Spark (quant requis, perte)DGX Station (quant requis, perte)
DeepSeek V4 Flash 0731167 GoUD-IQ3_XXS 104 Go (-2 à -3 pt MMLU)natif FP4+FP8 (0 pt) ou UD-Q4_K_XL (-0,3 pt)natif FP4+FP8 (0 pt) ou UD-Q8_K_XL lossless (0 pt)
Llama 3.1 70B~70 GoAWQ Q4 (-0,5 pt)natif BF16 (0 pt)natif BF16 (0 pt)
Qwen3 235B~235 Goimpossible (dépasse)UD-Q4_K_XL (-0,3 pt)natif FP8 (0 pt)
Mistral Large 2 123B~123 GoUD-Q4_K_XL (-0,3 pt)natif FP4 (0 pt)natif (0 pt)
Llama 3.1 405B~406 Goimpossibleimpossible natifAWQ Q4 (-0,5 pt)
GLM 4.5~358 Goimpossibleimpossible natifAWQ Q4 (-0,5 pt)
DeepSeek V4 Pro Preview~470 GoimpossibleimpossibleUD-Q4_K_XL (-0,3 pt)
Kimi K2~1 026 GoimpossibleimpossibleAWQ Q4 (-0,5 pt)

Deux familles de perte à distinguer : (1) QAT-aware comme DeepSeek V4 Flash 0731, entraîné quantization-aware — les experts MXFP4 natifs sont repackés bit-for-bit, la perte est ~0 sur UD-IQ3_XXS malgré une réduction de 37 % (167 → 104 Go). (2) Post-training quantization comme AWQ Q4 sur Llama 3 ou Mistral, qui descend à 4 bits sans avoir été entraînée pour — perte typique de 0,5 à 1 pt MMLU et dégradation visible sur le code. La différence est l'origine : DeepSeek a intégré la quantization dans le training, pas les autres.

Référence croisée : Aider Polyglot sur DeepSeek V3.1 (modèle comparable MoE) montre que UD 5-bit ≈ full-precision (70,7 % Aider Pass-2 ≈ BF16), tandis que la conversion classique AWQ 4-bit sur un modèle non-QAT descend sous les 60 %.

Quels modèles tiennent sur la machine

ModèlePoids natifDGX Spark 128 GoCluster de 2 DGX Spark 256 GoDGX Station 748 Go
DeepSeek V4 Flash 0731 (natif FP4+FP8)167 GoFP4 agressif ou --cpu-offloadnatifnatif FP4+FP8
DeepSeek V4 Flash 0731 (UD-IQ3_XXS)104 Gorecommandé (18 Go KV)natifnatif
DeepSeek V4 Flash 0731 (UD-Q8_K_XL lossless)162 Godépassenatifnatif lossless
Llama 3.1 70B~70 GoAWQ Q4 ou FP8natif BF16natif BF16
Qwen3 235B~235 GoimpossibleFP4natif FP8
Llama 3.1 405B~406 Goimpossibleimpossible natifAWQ Q4
DeepSeek V4 Pro Preview~470 GoimpossibleimpossibleFP4 uniquement

KV cache : formule et dimensionnement

Le calcul du cache clé-valeur est la donnée structurante du dimensionnement : V4 Flash 0731 utilise un Grouped Query Attention (GQA) extrêmement agressif1 tête KV pour 64 têtes de requête. Cette compression (la plus agressive du marché pour un MoE 284 B) divise le footprint KV par 64 par rapport à un MHA classique.

Formule : KV par token = 2 × head_dim × n_kv_heads × bytes_par_valeur × n_couches

Avec la config officielle deepseek-ai/DeepSeek-V4-Flash-0731/config.json (head_dim=512, num_key_value_heads=1, num_hidden_layers=43) :

À titre de comparaison, Llama 3 70B en GQA 8/64 atteint 320 KB/token, soit 7,4× plus lourd que V4 Flash 0731.

Calculette KV cache et contexte

Sélectionnez votre machine, le modèle à servir et le format KV cache. La calculette affiche instantanément la mémoire disponible pour le KV cache, le contexte maximum et le nombre d'utilisateurs concurrents par taille de contexte.

Le calcul du cache clé-valeur est la donnée structurante du dimensionnement : V4 Flash 0731 utilise un Grouped Query Attention (GQA) extrêmement agressif1 tête KV pour 64 têtes de requête. Cette compression (la plus agressive du marché pour un MoE 284 B) divise le footprint KV par 64 par rapport à un MHA classique.

Formule : KV par token = 2 × head_dim × n_kv_heads × bytes_par_valeur × n_couches

Avec la config officielle deepseek-ai/DeepSeek-V4-Flash-0731/config.json (head_dim=512, num_key_value_heads=1, num_hidden_layers=43) :

À titre de comparaison, Llama 3 70B en GQA 8/64 atteint 320 KB/token, soit 7,4× plus lourd que V4 Flash 0731.

Configurationctx 8Kctx 32Kctx 128Kctx 1M
DGX Spark 128 Go, UD-IQ3_XXS 104 Go
Utilisateurs concurrents (FP8 KV)621530
Contexte max single-user500 K jetons
Cluster de 2 DGX Spark 256 Go, UD-Q8_K_XL lossless 162 Go
Utilisateurs concurrents27067162
Contexte max single-user1 M (plafonné modèle)
DGX Station GB300 748 Go, UD-Q8_K_XL lossless 162 Go
Utilisateurs concurrents1 73543310813
Contexte max single-user1 M (plafonné modèle)

Vitesses réelles (decode + préremplissage)

MachineModèleDécode single-userPréremplissage 1M ctx (FP8)
DGX Spark (273 Go/s)UD-IQ3_XXS 104 Go2,6 tok/s1 min 44 s
DGX Spark (273 Go/s)UD-IQ2_M 91 Go3,0 tok/sn/a
Cluster de 2 DGX Spark (546 Go/s)UD-IQ3_XXS 104 Go5,2 tok/s52 s
DGX Station GB300 (HBM3e 7,1 To/s)UD-IQ3_XXS 104 Go68 tok/s2,6 s
DGX Station GB300 (HBM3e 7,1 To/s)UD-Q8_K_XL 162 Go44 tok/sn/a
DGX Station GB300 (HBM3e 7,1 To/s)natif FP4+FP8 167 Go42 tok/sn/a

Référence NVIDIA officielle sur DGX Spark pour d'autres modèles : Qwen3 14B atteint 22,71 tok/s en NVFP4, GPT-OSS-120B atteint 55,37 tok/s en MXFP4. Avec deux DGX Sparks en tensor-parallel, Qwen3 235B (qui ne tient pas sur un seul nœud) tourne à 11,73 tok/s agrégé.

Recette pas-à-pas pour un DGX Spark

Voir la fiche complète DGX Spark pour les alternatives OEM et les détails hardware.

  1. Mettre à jour DGX OS et le driver NVIDIA (CUDA 12.8+, sm_120).
  2. Tirer l'image NGC officielle :
    docker pull nvcr.io/nvidia/vllm:25.04-py3-aarch64
  3. Lancer le container en montant le cache Hugging Face :
    docker run --gpus all \
      -v $HOME/.cache/huggingface:/root/.cache/huggingface \
      -p 8000:8000 \
      nvcr.io/nvidia/vllm:25.04-py3-aarch64
  4. Servir V4 Flash 0731 avec vLLM 0.25+ :
    vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
      --trust-remote-code \
      --kv-cache-dtype fp8 \
      --block-size 256 \
      --enable-expert-parallel \
      --moe-backend deep_gemm_mega_moe \
      --attention-config '{"use_fp4_indexer_cache": true}' \
      --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
  5. Tester l'API compatible OpenAI :
    curl http://127.0.0.1:8000/v1/chat/completions \
      -H 'Content-Type: application/json' \
      -d '{
        "model": "deepseek-ai/DeepSeek-V4-Flash-0731",
        "messages": [{"role":"user","content":"Bonjour"}],
        "max_tokens": 256
      }'

Pour utiliser un GGUF Unsloth à la place du safetensors natif : ollama run unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-IQ3_XXS ou via llama.cpp récent avec support sm_120/sm_103.

Recette pas-à-pas pour un cluster de 2 DGX Spark

Schéma de répartition mémoire d'un cluster 2× DGX Spark relié par ConnectX-7 200 Gb/s en RDMA/RoCE v2 : 2 nœuds de 128 Go unifiée LPDDR5x chacun. En tensor-parallel natif, V4 Flash 0731 est shardé ~83 Go par Spark. Le KV cache FP8 est réparti entre les 2 pools. L'all-reduce NCCL passe par le lien ConnectX-7 à 200 Gb/s (= 25 Go/s).Schéma de répartition mémoire d'un cluster 2× DGX Spark relié par ConnectX-7 200 Gb/s en RDMA/RoCE v2 : 2 nœuds de 128 Go unifiée LPDDR5x chacun. En tensor-parallel natif, V4 Flash 0731 est shardé ~83 Go par Spark. Le KV cache FP8 est réparti entre les 2 pools. L'all-reduce NCCL passe par le lien ConnectX-7 à 200 Gb/s (= 25 Go/s).
Allocation mémoire du cluster 2× DGX Spark relié par ConnectX-7 200 Gb/s (RDMA/RoCE v2). Chaque Spark porte 128 Go LPDDR5x unifiée (273 Go/s). En tensor-parallel natif, V4 Flash 0731 (167 Go) est shardé ~83 Go par nœud. Le KV cache FP8 (~43 Go par contexte 1M utilisateur) est réparti entre les 2 pools. Les all-reduce NCCL traversent le lien ConnectX-7 à 200 Gb/s (≈ 25 Go/s effectif) — overhead ~30× vs NVLink intra-socket, acceptable pour le décodage single-user mais pénalisant en batch important.

Voir aussi : Dynamo pour la distribution d'inférence sur grandes flottes GPU, et le routeur sémantique QDNA pour orchestrer plusieurs clusters.

  1. Relier les deux DGX Spark par un câble DAC QSFP-DD 200 Gb/s (≈ 100 €) sur les ports ConnectX-7.
  2. Configurer l'IP statique RoCE sur les deux nœuds :
    # Spark maître
    sudo ip addr add 10.10.10.1/24 dev 
    
    # Spark worker
    sudo ip addr add 10.10.10.2/24 dev 
  3. Démarrer Ray head sur le Spark maître :
    ray start --head --port=6379 --num-gpus=1
  4. Joindre le second Spark :
    ray start --address='10.10.10.1:6379' --num-gpus=1 --block
  5. Vérifier le cluster puis servir en tensor-parallel sur 2 nœuds :
    ray status
    vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
      --trust-remote-code \
      --tensor-parallel-size 2 \
      --enable-expert-parallel \
      --kv-cache-dtype fp8 \
      --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

Pièges ARM64 et unified memory

Conclusion : quelle machine pour quel usage

Pour un usage d'entreprise sur V4 Flash 0731, l'écosystème QDNA propose plusieurs briques complémentaires à déployer selon le besoin : la passerelle vLLM pour servir le modèle, Unsloth pour le fine-tuning QLoRA, la fiche DGX Spark et la fiche DGX Station pour le dimensionnement matériel, et la pile dwarfstar pour assembler le tout sur un serveur RTX PRO 6000 quand la taille du modèle le permet.

Le DGX Spark seul fait tourner DeepSeek V4 Flash 0731 dans son format natif FP4+FP8, à un débit limité par les 273 Go/s de bande passante unifiée. C'est la bonne cible pour un usage individuel ou une équipe qui accepte un débit modeste sur des contextes courts.

Un cluster de 2 DGX Spark n'apporte un gain que dans deux cas : faire tenir un modèle qui dépasse 128 Go en shardant (par exemple Llama 3 70B BF16, ou une version quantifiée agressive d'un plus gros modèle), ou servir plus d'utilisateurs concurrents en agrégeant deux pools disjoints.

La DGX Station GB300 est la cible privilégiée pour DeepSeek V4 Flash 0731 en production. Son pool cohérent de 748 Go (252 Go HBM3e GPU à 7,1 To/s + 496 Go LPDDR5X CPU à 396 Go/s, reliés en NVLink-C2C à 900 Go/s) traitent le modèle sans compression agressive, et le 1M de contexte devient tenable grâce au cache clé-valeur FP8 et à use_fp4_indexer_cache. C'est la machine qui justifie le passage à l'échelle d'une PME ou d'une grande entreprise, à condition d'accepter le budget et les 1 600 W de consommation.

Questions fréquentes

Quel budget prévoir pour un cluster de 2 DGX Spark plus DGX Station ?

Le cluster 2x Spark revient a environ 12 100 EUR (deux unites DGX Spark a 6 000 EUR et un cable DAC QSFP-DD 200 Gb/s), et la DGX Station GB300 se positionne autour de 120 000 USD aux USA selon ServeTheHome. Le total avoisine 132 100 EUR pour le duo Spark + Station, hors installation et electricite.

128 Go de memoire unifiee sur DGX Spark suffisent-ils pour DeepSeek V4 Flash 0731 ?

Avec les bons GGUFs Unsloth Dynamic, oui. Le GGUF UD-IQ3_XXS pese 104 Go (recommande par Unsloth pour 128 Go), UD-IQ2_M pese 91 Go (tres a l'aise), UD-Q8_K_XL pese 162 Go (lossless, depasse). Avec UD-IQ3_XXS charge sur le pool unifie 128 Go, il reste 18 a 24 Go pour le KV cache, et le contexte 1M tient avec compression FP8 KV + use_fp4_indexer_cache. En format natif FP4+FP8 (167 Go), il faut activer --cpu-offload-gb ou viser DGX Station.

vLLM tourne-t-il vraiment sur ARM64 SBSA avec les superpucs GB10 et GB300 ?

Oui. Les containers NVIDIA NGC publient des variantes aarch64 SBSA avec CUDA 12.8+ et PyTorch 2.5 nightly. DeepSeek V4 Flash 0731 exige vLLM 0.25.0 minimum a cause du module DSpark fusionne dans le checkpoint.

Quel debit tokens par seconde attendre selon la machine ?

Avec Unsloth Dynamic NVFP4 sur Blackwell GB10/GB300, les gains annonces vont jusqu'a 2,5x par rapport au BF16 natif, plus 2x de contexte via le KV cache FP8 calibre. Pour DeepSeek V4 Flash 0731, la documentation officielle ne publie pas de chiffre tokens/s unique. Estimation sur DGX Spark GB10 (273 Go/s de bande passante unifiee) : 3 a 5 tok/s en decode natif BF16, 8 a 15 tok/s en UD-IQ3_XXS avec NVFP4 active, jusqu'a 30 tok/s en UD-IQ2_M avec batch important. Sur DGX Station GB300 (HBM3e GPU @ 7,1 To/s, LPDDR5X CPU @ 396 Go/s) : 50-80 tok/s en HBM3e (modèle placé sur GPU) en UD-IQ3_XXS, jusqu'a 150 tok/s en UD-IQ2_M.

Faut-il privilegier le DGX Spark, le cluster 2x Spark ou la DGX Station ?

Le DGX Spark seul suffit pour faire tourner DeepSeek V4 Flash 0731 en quantization FP4. Le cluster 2x Spark permet de faire tenir Llama 3 70B BF16 ou des modeles jusqu'a 235B comme Qwen3 235B. La DGX Station GB300 traite les modeles jusqu'a 700B+ grâce à 252 Go HBM3e GPU @ 7,1 To/s + 496 Go LPDDR5X CPU @ 396 Go/s (cohérent 748 Go via NVLink-C2C), sans aucune compression sur V4 Flash 0731.

Quelle difference entre DeepSeek V4 Flash 0731 et V4 Pro Preview ?

V4 Flash 0731 est un MoE de 284 milliards de parametres avec 13 milliards actifs par token. V4 Pro Preview monte a 1,6 mille milliards avec 49 milliards actifs. Sur la table agentique publiee par DeepSeek, Flash 0731 depasse Pro Preview sur Terminal Bench 2.1, NL2Repo, Cybergym, DeepSWE et Toolathlon. Le ratio de memoire est plus favorable sur Flash : 167 Go pour Flash 0731 contre pres de 470 Go pour Pro en FP4+FP8, ce qui rend Flash accessible a un cluster Spark 2x avec quantization alors que Pro exige la DGX Station.

Comparer une inference locale sur DGX au cloud OpenAI ou Anthropic : ou est le point de bascule ?

Le sur site devient rentable autour de quelques dizaines d'utilisateurs reguliers, et nettement avantageux au-dela de la centaine en charge continue. Pour les charges agentiques, le cache cle-valeur local rend les prefixes repetes quasi gratuits, ce que ne permet pas le paiement au jeton. La souverainete impose le local des que la donnee est sensible, independamment du cout. Pour le prix reel observe aux USA, la DGX Station GB300 tourne entre 120 000 et 125 000 dollars selon ServeTheHome, avec un plancher improbable sous 80 000 a 85 000 dollars.

Quels OEM vendent la DGX Station GB300 et a quel prix ?

Les OEM confirmes a GTC 2026 sont ASUS ExpertCenter Pro ET900N G3, Dell Pro Max FCT6263, MSI XpertStation WS300, HP ZGX Fury (programme Priority Access), Gigabyte W775-V10-L01 et Supermicro Super AI Station. Aucun ne publie de prix public : Dell, MSI et Supermicro renvoient a un contact commercial. Les prix observes aux USA se situent entre 120 000 et 125 000 USD selon ServeTheHome.

Quels modeles alternatifs tiennent sur le materiel DGX ?

DGX Spark 128 Go : Llama 3.1 8B, Qwen3 32B en natif, Llama 3.1 70B et Mistral Large 2 123B en AWQ Q4 ou FP8. Cluster 2× Spark 256 Go : les memes plus GPT-OSS-120B natif, Qwen3 235B en FP4. DGX Station 748 Go : tous les precedents en natif, plus GLM 4.5 en AWQ Q4 et DeepSeek V4 Pro Preview en FP4. Kimi K2 (1 026 Go natif) ne tient sur aucune configuration en natif.

Dimensionner votre plateforme DeepSeek V4

Un échange pour cadrer votre cas d'usage (RAG interne, agents de code, raisonnement long), choisir entre DGX Spark, cluster 2× Spark et DGX Station GB300, et valider la recette vLLM sur votre infrastructure.

Réserver un échange

Références