QDNAVente et intégration de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

Servir Nemotron 3 Ultra avec Triton Inference Server

Nemotron 3 Ultra compte 550 milliards de paramètres. Triton Inference Server vise mise en service industrielle, multi-modèles. Cette page donne la mémoire nécessaire et les plateformes qui conviennent.

Réponse courte. Triton Inference Server sert Nemotron 3 Ultra dès lors que la machine offre au moins 316 Go de mémoire, empreinte des poids en NVFP4. 7 des 8 plateformes du catalogue y parviennent.

Quelle mémoire faut-il au minimum ?

Nemotron 3 Ultra totalise 550 milliards de paramètres. En NVFP4, ses poids occupent environ 316 Go, marge d’exécution comprise. En FP8 l’empreinte double, à environ 632 Go. Le cache d’attention s’ajoute et dépend du contexte servi.

À quoi sert Triton Inference Server ?

Triton Inference Server vise mise en service industrielle, multi-modèles. Voir la fiche Triton Inference Server et la fiche Nemotron 3 Ultra.

Sur quelles plateformes ?

Quelle mémoire pour Nemotron 3 Ultra avec Triton Inference Server ?

Environ 316 Go en NVFP4 pour les poids, hors cache d’attention.

Triton Inference Server convient-il à Nemotron 3 Ultra ?

Triton Inference Server sert Nemotron 3 Ultra dès lors que la machine offre au moins 316 Go de mémoire, empreinte des poids en NVFP4. 7 des 8 plateformes du catalogue y parviennent.

Méthode

Les valeurs proviennent des fiches du site. Les empreintes mémoire sont calculées, elles ne sont pas mesurées : un relevé sur machine peut s’en écarter selon le moteur et le format exact des poids. Les prix sont indicatifs et non contractuels.