MiniMax M3
MiniMax

MiniMax M3 traite le contexte long et le multimodal à faible coût. Il totalise 428 milliards de paramètres, dont 23 milliards actifs, avec un contexte d’un million de tokens et une attention creuse. Il convient aux documents volumineux et à l’image.
Points clés : Multimodal · Mélange d’experts 428 Md · Contexte 1M · Attention creuse · Économique.
Architecture
MiniMax M3 totalise 428 milliards de paramètres, dont 23 milliards actifs, avec un contexte d’un million de tokens et une attention creuse qui abaisse le coût sur les longues séquences.
Points forts
Il traite le contexte long et le multimodal à faible coût, texte et image compris.
Cas d’usage
MiniMax M3 convient aux documents volumineux, à l’analyse d’images et aux flux où le coût par token prime.
Déploiement
Servi par vLLM sur serveur GPU, ou consommé par API. Il s’intègre à la plateforme via LiteLLM.
Tous les modèles de la plateforme sont interchangeables via une passerelle unique : changer de modèle revient à changer une ligne de configuration, sans réécrire le code. La priorité reste l’exécution locale.
Sur quelle machine faire tourner MiniMax M3 ?
MiniMax M3 totalise 428 milliards de paramètres, soit environ 246 Go en NVFP4. 7 plateformes du catalogue disposent d’assez de mémoire.
- MiniMax M3 sur Mac Studio Ultra
- MiniMax M3 sur DGX Station
- MiniMax M3 sur Serveur RTX PRO 6000
- MiniMax M3 sur Serveur H200 SXM
- MiniMax M3 sur B200 SXM
- MiniMax M3 sur B300 SXM
- MiniMax M3 sur GB300 NVL72
Voir aussi MiniMax M3 en NVFP4 et la matrice complète.