QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

Nemotron 3 Ultra

NVIDIA

Nemotron 3 Ultra

Nemotron 3 Ultra représente le modèle ouvert américain le plus performant. Il combine 550 milliards de paramètres, dont 55 milliards actifs, dans une architecture Mamba 2 associée à un transformeur, au format NVFP4, avec un contexte d’un million de tokens. Il s’accorde avec la pile NVIDIA AI Enterprise.

Points clés : Ouvert américain · Mamba 2 plus transformeur · NVFP4 · Contexte 1M · NVIDIA AI Enterprise.

Architecture

Nemotron 3 Ultra combine 550 milliards de paramètres, dont 55 milliards actifs, dans une architecture Mamba 2 associée à un transformeur, au format NVFP4, avec un contexte d’un million de tokens.

Points forts

Il constitue le modèle ouvert américain de référence et s’accorde avec la pile NVIDIA AI Enterprise.

Cas d’usage

Nemotron convient au contexte long et aux déploiements alignés sur l’écosystème NVIDIA, avec support d’entreprise.

Déploiement

Servi par vLLM ou Triton au format NVFP4 sur GPU Blackwell, il tire parti de l’accélération matérielle FP4.

Tous les modèles de la plateforme sont interchangeables via une passerelle unique : changer de modèle revient à changer une ligne de configuration, sans réécrire le code. La priorité reste l’exécution locale.

Déployer ce modèle chez vous

Sur votre matériel, sans que vos données sortent.

Réserver un échange

Sur quelle machine faire tourner Nemotron 3 Ultra ?

Nemotron 3 Ultra totalise 550 milliards de paramètres, soit environ 316 Go en NVFP4. 7 plateformes du catalogue disposent d’assez de mémoire.

Voir aussi Nemotron 3 Ultra en NVFP4 et la matrice complète.