GB300 NVL72
Échelle rack, 72 GPU refroidis par liquide

| Prix indicatif | à partir de 3,9 M€, estimation hors intégration (guide des prix) |
|---|---|
| GPU | 72 Blackwell Ultra et 36 Grace (2592 cœurs) |
| Mémoire | environ 20,7 To HBM3e (40 To de mémoire rapide) |
| Calcul | environ 1,1 ExaFLOPS FP4 en dense |
| NVLink | 130 To/s sur un domaine de 72 GPU |
| Consommation | environ 120 kW, refroidissement liquide |
| Format | rack 42U complet |
Ce que la machine exécute
Un seul supercalculateur de 72 puces sert les modèles frontière et un cloud IA privé. Runtime conseillé : vLLM désagrégé avec LiteLLM.
Positionnement
La grande entreprise héberge son propre modèle frontière dans une baie, en cloud IA souverain.
Constructeurs
Assemblage rack chez Dell, HPE, Lenovo, Supermicro, ASUS et Gigabyte, en refroidissement liquide.
Stockage GPUDirect
Sur les plateformes équipées de cartes ConnectX, la technologie GPUDirect Storage établit un chemin direct entre le stockage NVMe ou NVMe over Fabric et la mémoire du GPU, sans passer par le tampon du processeur. Le débit soutenu atteint environ 50 gigaoctets par seconde par lien. Les baies compatibles, telles NetApp, VAST, DDN ou WEKA, alimentent l’entraînement et le RAG massif à pleine vitesse.
Support
Pile ouverte supportée par QDNA et les communautés. Option NVIDIA AI Enterprise (NIM, NeMo, Triton) avec engagement de niveau de service, par carte.
Configurer ce matériel
Un échange sans engagement pour dimensionner votre plateforme.
Réserver un échangeQuels modèles tiennent sur GB300 NVL72 ?
La machine offre 20 700 Go de mémoire HBM3e, baie 72. 7 des 7 modèles ouverts du catalogue y logent, dans le format indiqué.
- GLM 5.2, FP16
- Kimi K3, FP16
- Kimi K2.7 Code, FP16
- DeepSeek V4, FP16
- Nemotron 3 Ultra, FP16
- MiniMax M3, FP16
- Qwen 3.6 27B, FP16
Voir la matrice complète.
Questions fréquentes
Combien coûte un gb300 nvl72 configuré pour un LLM ?
Le tarif varie selon la configuration choisie et le fournisseur. Nous communiquons des plages indicatives dans la fiche et un devis détaillé après cadrage.
Quel modèle LLM fait tenir dans un gb300 nvl72 ?
Selon le format de quantification et le contexte d'entrée. Le tableau de la page indique la taille de modèle maximale recommandée.
Quels runtimes sont compatibles avec le gb300 nvl72 ?
vLLM, llama.cpp, Triton Inference Server selon le framework retenu. Les versions testées par QDNA sont listées en bas de fiche.