QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

Serveur RTX PRO 6000

Serveur GPU refroidi par air, Blackwell Server Edition

Réponse courte. Le serveur RTX PRO 6000 embarque le GPU Blackwell Server Edition en refroidissement par air sur châssis standard. Il sert plusieurs modèles de 70 à 200 milliards de paramètres en parallèle, le RAG et le réglage fin multi-GPU, avec vLLM. C’est le cheval de bataille souverain au meilleur coût par token, socle du stack dwarfstar.
Serveur RTX PRO 6000
Prix indicatifde 250 000 à 350 000 €, estimation hors intégration (guide des prix)
Mémoire96 Go GDDR7 par GPU (2 à 8 GPU, jusqu’à 768 Go)
Calculenviron 4 PFLOPS FP4 avec sparsité par GPU
Bande passante1,6 To/s, PCIe Gen5
IsolationMIG jusqu’à quatre instances de 24 Go
Consommation600 W par GPU, air
Densité2 à 8 GPU par serveur

Quels modèles le serveur RTX PRO 6000 exécute-t-il ?

Plusieurs modèles de 70 à 200 milliards de paramètres en parallèle, RAG et réglage fin multi-GPU. Runtime conseillé : vLLM. Socle du stack dwarfstar.

Pourquoi choisir un serveur RTX PRO 6000 ?

Le cheval de bataille souverain fonctionne en refroidissement par air sur des serveurs standards, avec le meilleur rapport coût sur token.

Constructeurs

Serveurs certifiés chez Dell, HPE, Lenovo, Supermicro, ASUS et Gigabyte.

Stockage GPUDirect

Sur les plateformes équipées de cartes ConnectX, la technologie GPUDirect Storage établit un chemin direct entre le stockage NVMe ou NVMe over Fabric et la mémoire du GPU, sans passer par le tampon du processeur. Le débit soutenu atteint environ 50 gigaoctets par seconde par lien. Les baies compatibles, telles NetApp, VAST, DDN ou WEKA, alimentent l’entraînement et le RAG massif à pleine vitesse.

Support

Pile ouverte supportée par QDNA et les communautés. Option NVIDIA AI Enterprise (NIM, NeMo, Triton) avec engagement de niveau de service, par carte.

Questions fréquentes

À quoi sert un serveur RTX PRO 6000 ?

À servir en production plusieurs modèles de 70 à 200 milliards de paramètres en parallèle, faire du RAG et du réglage fin multi-GPU, au meilleur coût par token.

Le RTX PRO 6000 est-il refroidi par air ou par liquide ?

Par air, sur des serveurs standards. C’est ce qui rend la plateforme déployable sans salle machine spécialisée.

Quel runtime pour le RTX PRO 6000 ?

vLLM, qui exploite le parallélisme multi-GPU et le format NVFP4 des cartes Blackwell.

Chez quels constructeurs le serveur RTX PRO 6000 est-il certifié ?

Chez Dell, HPE, Lenovo, Supermicro, ASUS et Gigabyte.

Combien coûte un rtx pro 6000 configuré pour un LLM ?

Le tarif varie selon la configuration choisie et le fournisseur. Nous communiquons des plages indicatives dans la fiche et un devis détaillé après cadrage.

Quel modèle LLM fait tenir dans un rtx pro 6000 ?

Selon le format de quantification et le contexte d'entrée. Le tableau de la page indique la taille de modèle maximale recommandée.

Quels runtimes sont compatibles avec le rtx pro 6000 ?

vLLM, llama.cpp, Triton Inference Server selon le framework retenu. Les versions testées par QDNA sont listées en bas de fiche.

Configurer ce matériel

Un échange sans engagement pour dimensionner votre plateforme.

Réserver un échange

Quels modèles tiennent sur Serveur RTX PRO 6000 ?

La machine offre 768 Go de mémoire GDDR7, 8 GPU. 5 des 7 modèles ouverts du catalogue y logent, dans le format indiqué.

Voir la matrice complète.