B200 SXM
HGX B200, Blackwell 8 GPU

| Prix indicatif | sur devis, selon la configuration (guide des prix) |
|---|---|
| Mémoire | 180 Go HBM3e par GPU (1440 Go) |
| Bande passante | 7,7 To/s par GPU |
| Calcul | environ 9 PFLOPS FP4 dense par GPU (72 au total) |
| NVLink | 1,8 To/s NVLink 5 (14,4 To/s au total) |
| Consommation | environ 1 kW par GPU |
| Transistors | 208 milliards par GPU |
Que permet un serveur B200 SXM ?
Inférence de niveau frontière et entraînement, débit FP4 élevé. Runtime conseillé : vLLM au format NVFP4.
B200 ou H200 : lequel choisir ?
Le passage à Blackwell atteint quinze fois la génération Hopper sur les très grands modèles.
Constructeurs
Systèmes HGX B200 chez Dell, HPE, Lenovo, Supermicro, ASUS et Gigabyte.
Stockage GPUDirect
Sur les plateformes équipées de cartes ConnectX, la technologie GPUDirect Storage établit un chemin direct entre le stockage NVMe ou NVMe over Fabric et la mémoire du GPU, sans passer par le tampon du processeur. Le débit soutenu atteint environ 50 gigaoctets par seconde par lien. Les baies compatibles, telles NetApp, VAST, DDN ou WEKA, alimentent l’entraînement et le RAG massif à pleine vitesse.
Support
Pile ouverte supportée par QDNA et les communautés. Option NVIDIA AI Enterprise (NIM, NeMo, Triton) avec engagement de niveau de service, par carte.
Questions fréquentes
Quel gain le B200 apporte-t-il face au H200 ?
Le passage à l’architecture Blackwell atteint jusqu’à quinze fois la performance de la génération Hopper sur les très grands modèles, avec un débit FP4 nettement supérieur.
À quoi sert un serveur B200 SXM ?
À l’inférence de niveau frontière et à l’entraînement des modèles les plus lourds, là où le débit FP4 fait la différence.
Quel format de modèle sur B200 ?
NVFP4, servi par vLLM, qui exploite le calcul FP4 natif des cartes Blackwell.
B200 ou H200 pour mon projet ?
Le H200 suffit pour la plupart des charges d’inférence et d’entraînement ; le B200 vise les très grands modèles et le débit FP4 maximal.
Combien coûte un b200 sxm configuré pour un LLM ?
Le tarif varie selon la configuration choisie et le fournisseur. Nous communiquons des plages indicatives dans la fiche et un devis détaillé après cadrage.
Quel modèle LLM fait tenir dans un b200 sxm ?
Selon le format de quantification et le contexte d'entrée. Le tableau de la page indique la taille de modèle maximale recommandée.
Quels runtimes sont compatibles avec le b200 sxm ?
vLLM, llama.cpp, Triton Inference Server selon le framework retenu. Les versions testées par QDNA sont listées en bas de fiche.
Configurer ce matériel
Un échange sans engagement pour dimensionner votre plateforme.
Réserver un échangeQuels modèles tiennent sur B200 SXM ?
La machine offre 1 440 Go de mémoire HBM3e, 8 GPU. 6 des 7 modèles ouverts du catalogue y logent, dans le format indiqué.
- GLM 5.2, FP8
- Kimi K2.7 Code, FP8
- DeepSeek V4, NVFP4
- Nemotron 3 Ultra, FP16
- MiniMax M3, FP16
- Qwen 3.6 27B, FP16
Voir la matrice complète.