QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

Serveur H200 SXM

HGX H200, 8 GPU SXM

Réponse courte. Le serveur H200 SXM est une carte HGX à huit GPU reliés en maillage NVSwitch, soit un pool mémoire de 1128 gigaoctets. Il fait travailler les huit accélérateurs comme un seul, pour l’entraînement et l’inférence des grands modèles, en parallélisme tensoriel sous vLLM. La licence NVIDIA AI Enterprise se souscrit par GPU.
Serveur H200 SXM
Prix indicatifde 350 000 à 500 000 €, estimation hors intégration (guide des prix)
Mémoire141 Go HBM3e par GPU, 8 GPU (1128 Go)
Bande passante4,8 To/s par GPU
NVLink900 Go/s par GPU, maillage complet NVSwitch
CalculFP8 et FP16, parallélisme tensoriel sur 8 GPU
Consommationjusqu’à 700 W par GPU
Formatcarte HGX 8 GPU, serveur 8U

Que permet un serveur H200 SXM ?

Pool de 1128 Go pour l’inférence et l’entraînement à l’échelle : réglage fin, LoRA et pré-entraînement continu sur huit GPU reliés en maillage NVLink. Runtime conseillé : vLLM en parallélisme tensoriel.

Quand choisir une baie H200 SXM ?

La carte HGX H200 fait travailler huit GPU comme un seul accélérateur via NVSwitch, pour l’entraînement et l’inférence des grands modèles. La licence NVIDIA AI Enterprise se souscrit par GPU.

Constructeurs

Systèmes HGX H200 chez Dell, HPE, Lenovo, Supermicro, ASUS et Gigabyte.

Stockage GPUDirect

Sur les plateformes équipées de cartes ConnectX, la technologie GPUDirect Storage établit un chemin direct entre le stockage NVMe ou NVMe over Fabric et la mémoire du GPU, sans passer par le tampon du processeur. Le débit soutenu atteint environ 50 gigaoctets par seconde par lien. Les baies compatibles, telles NetApp, VAST, DDN ou WEKA, alimentent l’entraînement et le RAG massif à pleine vitesse.

Support

Pile ouverte supportée par QDNA et les communautés. Option NVIDIA AI Enterprise (NIM, NeMo, Triton) avec engagement de niveau de service, par GPU.

Questions fréquentes

Quelle mémoire totale sur un serveur H200 SXM ?

1128 gigaoctets, mis en commun sur huit GPU reliés en maillage NVLink via NVSwitch, adressables comme un seul pool.

À quoi sert une baie H200 SXM ?

À l’inférence et à l’entraînement à l’échelle des grands modèles : réglage fin, LoRA et pré-entraînement continu sur huit GPU.

Quel runtime pour le H200 SXM ?

vLLM en parallélisme tensoriel, qui répartit le modèle sur les huit GPU.

Comment se licencie NVIDIA AI Enterprise sur H200 ?

Par GPU, en option, avec engagement de niveau de service.

Combien coûte un h200 sxm configuré pour un LLM ?

Le tarif varie selon la configuration choisie et le fournisseur. Nous communiquons des plages indicatives dans la fiche et un devis détaillé après cadrage.

Quel modèle LLM fait tenir dans un h200 sxm ?

Selon le format de quantification et le contexte d'entrée. Le tableau de la page indique la taille de modèle maximale recommandée.

Quels runtimes sont compatibles avec le h200 sxm ?

vLLM, llama.cpp, Triton Inference Server selon le framework retenu. Les versions testées par QDNA sont listées en bas de fiche.

Configurer ce matériel

Un échange sans engagement pour dimensionner votre plateforme.

Réserver un échange

Quels modèles tiennent sur Serveur H200 SXM ?

La machine offre 1 128 Go de mémoire HBM3e, 8 GPU. 6 des 7 modèles ouverts du catalogue y logent, dans le format indiqué.

Voir la matrice complète.