QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

GB300 NVL72

Échelle rack, 72 GPU refroidis par liquide

GB300 NVL72
Prix indicatifà partir de 3,9 M€, estimation hors intégration (guide des prix)
GPU72 Blackwell Ultra et 36 Grace (2592 cœurs)
Mémoireenviron 20,7 To HBM3e (40 To de mémoire rapide)
Calculenviron 1,1 ExaFLOPS FP4 en dense
NVLink130 To/s sur un domaine de 72 GPU
Consommationenviron 120 kW, refroidissement liquide
Formatrack 42U complet

Ce que la machine exécute

Un seul supercalculateur de 72 puces sert les modèles frontière et un cloud IA privé. Runtime conseillé : vLLM désagrégé avec LiteLLM.

Positionnement

La grande entreprise héberge son propre modèle frontière dans une baie, en cloud IA souverain.

Constructeurs

Assemblage rack chez Dell, HPE, Lenovo, Supermicro, ASUS et Gigabyte, en refroidissement liquide.

Stockage GPUDirect

Sur les plateformes équipées de cartes ConnectX, la technologie GPUDirect Storage établit un chemin direct entre le stockage NVMe ou NVMe over Fabric et la mémoire du GPU, sans passer par le tampon du processeur. Le débit soutenu atteint environ 50 gigaoctets par seconde par lien. Les baies compatibles, telles NetApp, VAST, DDN ou WEKA, alimentent l’entraînement et le RAG massif à pleine vitesse.

Support

Pile ouverte supportée par QDNA et les communautés. Option NVIDIA AI Enterprise (NIM, NeMo, Triton) avec engagement de niveau de service, par carte.

Configurer ce matériel

Un échange sans engagement pour dimensionner votre plateforme.

Réserver un échange

Quels modèles tiennent sur GB300 NVL72 ?

La machine offre 20 700 Go de mémoire HBM3e, baie 72. 7 des 7 modèles ouverts du catalogue y logent, dans le format indiqué.

Voir la matrice complète.

Questions fréquentes

Combien coûte un gb300 nvl72 configuré pour un LLM ?

Le tarif varie selon la configuration choisie et le fournisseur. Nous communiquons des plages indicatives dans la fiche et un devis détaillé après cadrage.

Quel modèle LLM fait tenir dans un gb300 nvl72 ?

Selon le format de quantification et le contexte d'entrée. Le tableau de la page indique la taille de modèle maximale recommandée.

Quels runtimes sont compatibles avec le gb300 nvl72 ?

vLLM, llama.cpp, Triton Inference Server selon le framework retenu. Les versions testées par QDNA sont listées en bas de fiche.