Servir MiniMax M3 avec Triton Inference Server
MiniMax M3 compte 428 milliards de paramètres. Triton Inference Server vise mise en service industrielle, multi-modèles. Cette page donne la mémoire nécessaire et les plateformes qui conviennent.
Quelle mémoire faut-il au minimum ?
MiniMax M3 totalise 428 milliards de paramètres. En NVFP4, ses poids occupent environ 246 Go, marge d’exécution comprise. En FP8 l’empreinte double, à environ 492 Go. Le cache d’attention s’ajoute et dépend du contexte servi.
À quoi sert Triton Inference Server ?
Triton Inference Server vise mise en service industrielle, multi-modèles. Voir la fiche Triton Inference Server et la fiche MiniMax M3.
Sur quelles plateformes ?
- MiniMax M3 sur Mac Studio Ultra
- MiniMax M3 sur DGX Station
- MiniMax M3 sur Serveur RTX PRO 6000
- MiniMax M3 sur Serveur H200 SXM
- MiniMax M3 sur B200 SXM
- MiniMax M3 sur B300 SXM
Quelle mémoire pour MiniMax M3 avec Triton Inference Server ?
Environ 246 Go en NVFP4 pour les poids, hors cache d’attention.
Triton Inference Server convient-il à MiniMax M3 ?
Triton Inference Server sert MiniMax M3 dès lors que la machine offre au moins 246 Go de mémoire, empreinte des poids en NVFP4. 7 des 8 plateformes du catalogue y parviennent.
Méthode
Les valeurs proviennent des fiches du site. Les empreintes mémoire sont calculées, elles ne sont pas mesurées : un relevé sur machine peut s’en écarter selon le moteur et le format exact des poids. Les prix sont indicatifs et non contractuels.