QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

B300 SXM

HGX B300, Blackwell Ultra 8 GPU

B300 SXM
Prix indicatifde 500 000 à 800 000 €, estimation hors intégration (guide des prix)
Mémoire288 Go HBM3e par GPU (2304 Go)
Bande passante8 To/s par GPU
Calculenviron 15 PFLOPS FP4 par GPU (120 au total)
NVLinkNVLink 5, 1,8 To/s
Consommationenviron 1,4 kW par GPU, refroidissement liquide
Ciblemodèles frontière, contexte long

Ce que la machine exécute

Inférence et entraînement de grands modèles à l’échelle. Les plus grands modèles ouverts servis avec de la marge, y compris mélange d’experts et contexte d’un million de tokens. Runtime conseillé : vLLM avec déchargement du cache clé-valeur.

Positionnement

Le haut de gamme serveur ajoute 50 % de mémoire par GPU face au B200, pour le raisonnement et le contexte long. Une configuration huit GPU se situe entre 500 000 et 800 000 euros à titre d’estimation.

Constructeurs

Exemples HGX B300 : Dell PowerEdge XE9712, Supermicro SYS-821GB-TNRX, HPE Cray XD670, Lenovo ThinkSystem SR680b, Gigabyte G383-P00. ASUS complète l’offre sur la série ESC.

Stockage GPUDirect

Sur les plateformes équipées de cartes ConnectX, la technologie GPUDirect Storage établit un chemin direct entre le stockage NVMe ou NVMe over Fabric et la mémoire du GPU, sans passer par le tampon du processeur. Le débit soutenu atteint environ 50 gigaoctets par seconde par lien. Les baies compatibles, telles NetApp, VAST, DDN ou WEKA, alimentent l’entraînement et le RAG massif à pleine vitesse.

Support

Pile ouverte supportée par QDNA et les communautés. Option NVIDIA AI Enterprise (NIM, NeMo, Triton) avec engagement de niveau de service, par carte.

Configurer ce matériel

Un échange sans engagement pour dimensionner votre plateforme.

Réserver un échange

Quels modèles tiennent sur B300 SXM ?

La machine offre 2 304 Go de mémoire HBM3e, 8 GPU. 7 des 7 modèles ouverts du catalogue y logent, dans le format indiqué.

Voir la matrice complète.

Questions fréquentes

Combien coûte un b300 sxm configuré pour un LLM ?

Le tarif varie selon la configuration choisie et le fournisseur. Nous communiquons des plages indicatives dans la fiche et un devis détaillé après cadrage.

Quel modèle LLM fait tenir dans un b300 sxm ?

Selon le format de quantification et le contexte d'entrée. Le tableau de la page indique la taille de modèle maximale recommandée.

Quels runtimes sont compatibles avec le b300 sxm ?

vLLM, llama.cpp, Triton Inference Server selon le framework retenu. Les versions testées par QDNA sont listées en bas de fiche.