QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

MiniMax M3

MiniMax

MiniMax M3

MiniMax M3 traite le contexte long et le multimodal à faible coût. Il totalise 428 milliards de paramètres, dont 23 milliards actifs, avec un contexte d’un million de tokens et une attention creuse. Il convient aux documents volumineux et à l’image.

Points clés : Multimodal · Mélange d’experts 428 Md · Contexte 1M · Attention creuse · Économique.

Architecture

MiniMax M3 totalise 428 milliards de paramètres, dont 23 milliards actifs, avec un contexte d’un million de tokens et une attention creuse qui abaisse le coût sur les longues séquences.

Points forts

Il traite le contexte long et le multimodal à faible coût, texte et image compris.

Cas d’usage

MiniMax M3 convient aux documents volumineux, à l’analyse d’images et aux flux où le coût par token prime.

Déploiement

Servi par vLLM sur serveur GPU, ou consommé par API. Il s’intègre à la plateforme via LiteLLM.

Tous les modèles de la plateforme sont interchangeables via une passerelle unique : changer de modèle revient à changer une ligne de configuration, sans réécrire le code. La priorité reste l’exécution locale.

Déployer ce modèle chez vous

Sur votre matériel, sans que vos données sortent.

Réserver un échange

Sur quelle machine faire tourner MiniMax M3 ?

MiniMax M3 totalise 428 milliards de paramètres, soit environ 246 Go en NVFP4. 7 plateformes du catalogue disposent d’assez de mémoire.

Voir aussi MiniMax M3 en NVFP4 et la matrice complète.