Serveur H200 SXM
HGX H200, 8 GPU SXM

| Prix indicatif | de 350 000 à 500 000 €, estimation hors intégration (guide des prix) |
|---|---|
| Mémoire | 141 Go HBM3e par GPU, 8 GPU (1128 Go) |
| Bande passante | 4,8 To/s par GPU |
| NVLink | 900 Go/s par GPU, maillage complet NVSwitch |
| Calcul | FP8 et FP16, parallélisme tensoriel sur 8 GPU |
| Consommation | jusqu’à 700 W par GPU |
| Format | carte HGX 8 GPU, serveur 8U |
Que permet un serveur H200 SXM ?
Pool de 1128 Go pour l’inférence et l’entraînement à l’échelle : réglage fin, LoRA et pré-entraînement continu sur huit GPU reliés en maillage NVLink. Runtime conseillé : vLLM en parallélisme tensoriel.
Quand choisir une baie H200 SXM ?
La carte HGX H200 fait travailler huit GPU comme un seul accélérateur via NVSwitch, pour l’entraînement et l’inférence des grands modèles. La licence NVIDIA AI Enterprise se souscrit par GPU.
Constructeurs
Systèmes HGX H200 chez Dell, HPE, Lenovo, Supermicro, ASUS et Gigabyte.
Stockage GPUDirect
Sur les plateformes équipées de cartes ConnectX, la technologie GPUDirect Storage établit un chemin direct entre le stockage NVMe ou NVMe over Fabric et la mémoire du GPU, sans passer par le tampon du processeur. Le débit soutenu atteint environ 50 gigaoctets par seconde par lien. Les baies compatibles, telles NetApp, VAST, DDN ou WEKA, alimentent l’entraînement et le RAG massif à pleine vitesse.
Support
Pile ouverte supportée par QDNA et les communautés. Option NVIDIA AI Enterprise (NIM, NeMo, Triton) avec engagement de niveau de service, par GPU.
Questions fréquentes
Quelle mémoire totale sur un serveur H200 SXM ?
1128 gigaoctets, mis en commun sur huit GPU reliés en maillage NVLink via NVSwitch, adressables comme un seul pool.
À quoi sert une baie H200 SXM ?
À l’inférence et à l’entraînement à l’échelle des grands modèles : réglage fin, LoRA et pré-entraînement continu sur huit GPU.
Quel runtime pour le H200 SXM ?
vLLM en parallélisme tensoriel, qui répartit le modèle sur les huit GPU.
Comment se licencie NVIDIA AI Enterprise sur H200 ?
Par GPU, en option, avec engagement de niveau de service.
Combien coûte un h200 sxm configuré pour un LLM ?
Le tarif varie selon la configuration choisie et le fournisseur. Nous communiquons des plages indicatives dans la fiche et un devis détaillé après cadrage.
Quel modèle LLM fait tenir dans un h200 sxm ?
Selon le format de quantification et le contexte d'entrée. Le tableau de la page indique la taille de modèle maximale recommandée.
Quels runtimes sont compatibles avec le h200 sxm ?
vLLM, llama.cpp, Triton Inference Server selon le framework retenu. Les versions testées par QDNA sont listées en bas de fiche.
Configurer ce matériel
Un échange sans engagement pour dimensionner votre plateforme.
Réserver un échangeQuels modèles tiennent sur Serveur H200 SXM ?
La machine offre 1 128 Go de mémoire HBM3e, 8 GPU. 6 des 7 modèles ouverts du catalogue y logent, dans le format indiqué.
- GLM 5.2, FP8
- Kimi K2.7 Code, NVFP4
- DeepSeek V4, NVFP4
- Nemotron 3 Ultra, FP8
- MiniMax M3, FP16
- Qwen 3.6 27B, FP16
Voir la matrice complète.