QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

DGX Spark

Poste IA, superpuce GB10

Réponse courte. Le DGX Spark est un poste d’intelligence artificielle compact de NVIDIA, articulé autour de la superpuce GB10. Il exécute en local des modèles jusqu’à 200 milliards de paramètres quantifiés sur un nœud, et jusqu’à 405 milliards en reliant deux unités. Il met un modèle privé sur le bureau d’une TPE, sans cloud, avec llama.cpp ou vLLM.
DGX Spark
Prix indicatifde 5 900 à 7 800 €, estimation hors intégration (guide des prix)
Mémoire128 Go LPDDR5X unifiée
Calcul1 PFLOP FP4 (1000 TOPS)
PuceGB10 Grace Blackwell, 20 cœurs Arm
RéseauConnectX-7 200 GbE, cluster de 1 à 4 nœuds
Consommation170 W, prise murale
FormatDesktop 150 mm

Quels modèles le DGX Spark exécute-t-il ?

Modèles jusqu’à 200 milliards de paramètres quantifiés sur un nœud. En connexion directe à deux nœuds, la plateforme adresse jusqu’à 405 milliards de paramètres, et un commutateur ConnectX-7 étend le cluster au-delà. Runtime conseillé : llama.cpp ou vLLM en local.

Pour qui le DGX Spark est-il pertinent ?

Le poste souverain d’une TPE met un modèle privé sur le bureau, sans recours au cloud.

Constructeurs

NVIDIA décline le DGX Spark avec ses partenaires, dont ASUS, Dell, Gigabyte, HP, Lenovo et MSI.

Stockage GPUDirect

Sur les plateformes équipées de cartes ConnectX, la technologie GPUDirect Storage établit un chemin direct entre le stockage NVMe ou NVMe over Fabric et la mémoire du GPU, sans passer par le tampon du processeur. Le débit soutenu atteint environ 50 gigaoctets par seconde par lien. Les baies compatibles, telles NetApp, VAST, DDN ou WEKA, alimentent l’entraînement et le RAG massif à pleine vitesse.

Support

Pile ouverte supportée par QDNA et les communautés. Option NVIDIA AI Enterprise (NIM, NeMo, Triton) avec engagement de niveau de service, par carte.

Questions fréquentes

À quoi sert le DGX Spark ?

Le DGX Spark sert de poste d’inférence local pour une TPE ou un développeur : il met un modèle privé sur le bureau, sans dépendance au cloud.

Combien de paramètres le DGX Spark gère-t-il ?

Jusqu’à 200 milliards de paramètres quantifiés sur un seul nœud, et jusqu’à 405 milliards en reliant deux unités. Un commutateur ConnectX-7 étend le cluster au-delà.

Quel runtime pour le DGX Spark ?

llama.cpp pour les modèles compacts quantifiés, ou vLLM en local pour un service plus structuré.

Le DGX Spark remplace-t-il un serveur GPU ?

Non, il le complète. Pour servir de grands modèles en production, un serveur RTX PRO 6000 ou une baie H200 reste requis.

Combien coûte un dgx spark configuré pour un LLM ?

Le tarif varie selon la configuration choisie et le fournisseur. Nous communiquons des plages indicatives dans la fiche et un devis détaillé après cadrage.

Quel modèle LLM fait tenir dans un dgx spark ?

Selon le format de quantification et le contexte d'entrée. Le tableau de la page indique la taille de modèle maximale recommandée.

Quels runtimes sont compatibles avec le dgx spark ?

vLLM, llama.cpp, Triton Inference Server selon le framework retenu. Les versions testées par QDNA sont listées en bas de fiche.

Configurer ce matériel

Un échange sans engagement pour dimensionner votre plateforme.

Réserver un échange

Quels modèles tiennent sur DGX Spark ?

La machine offre 128 Go de mémoire LPDDR5X unifiée. 1 des 7 modèles ouverts du catalogue y logent, dans le format indiqué.

Voir la matrice complète.