Qwen3.8-Max-Preview : 2 400 milliards de paramètres, et des questions
Alibaba a teasé en juillet un modèle multimodal géant, quelques jours après la sortie de Kimi K3, sans rapport technique ni banc d'essai indépendant. Depuis le 8 août 2026, les poids du modèle de base sont publics sur Hugging Face. Voici ce que l'on savait, ce qui a été publié depuis, et ce que cela change pour un déploiement local.
Mis à jour le 1er septembre 2026 : le modèle de base Qwen/Qwen3.8-2.4T-A95B est public sur Hugging Face depuis le 8 août 2026 (2 400 milliards de paramètres, 95 milliards actifs, licence Qwen3.8-Max). Les passages qui affirmaient que les poids n'étaient pas publiés sont corrigés ; la version Max multimodale reste servie par l'API.

De quoi parle-t-on ?
Le 19 juillet 2026, l'équipe Qwen d'Alibaba a présenté Qwen3.8-Max-Preview, la nouvelle itération de sa gamme « Max ». Le modèle traiterait texte, images, vidéo et documents. Alibaba avance une taille de 2 400 milliards de paramètres et un positionnement juste derrière les meilleurs modèles du marché sur ses propres évaluations.
La preview est ouverte aux développeurs à 10 % du tarif standard via le Token Plan, et la version complète est promise sans échéance.
Chaque chiffre demande de la prudence : il s'agit d'une annonce commerciale et non d'une publication scientifique, aucun rapport technique n'accompagnant la préversion, et aucune équipe indépendante n'a pu mesurer le modèle.
Un mélange d'experts à très grande échelle
Comme les précédents modèles « Max », l'architecture repose sur un mélange d'experts clairsemé : le réseau contient un grand nombre d'experts, et un routeur n'en active qu'une petite fraction à chaque token. On obtient la capacité d'un modèle géant pour un coût de calcul par requête inférieur.
Les modèles ouverts que nous déployons, comme DeepSeek V4, Kimi K3 ou MiniMax M3, suivent le même principe à une échelle documentée.
Le nombre de paramètres actifs de Qwen3.8-Max n'avait pas été communiqué en juillet ; la fiche Hugging Face publiée en août le donne : 95 milliards actifs sur 2 400, avec 512 experts dont 10 routés et 1 partagé actifs à chaque token. C'est l'information qui détermine le coût réel d'inférence, la latence et le dimensionnement mémoire. Notre guide sur le matériel d'inférence détaille pourquoi ce chiffre commande tout le reste.
Des chiffres de performance à manier avec prudence
Aucun tableau de benchmark n'accompagnait la preview de juillet. La fiche Hugging Face du modèle de base, relue le 2 septembre 2026, en publie un pour Qwen3.8-Max, établi par Alibaba et non reproduit par un tiers ; en voici six lignes, dont le score Terminal Bench 2.1 est mesuré avec Claude Code (moyenne de dix passages, délai de cinq heures).
| Benchmark | Score Qwen3.8-Max (fiche de l'éditeur) |
|---|---|
| Terminal Bench 2.1 | 86,6 |
| SWE-bench Pro | 67,7 |
| Toolathlon Verified (Pass@1) | 72,5 |
| GPQA Diamond | 92,6 |
| Humanity's Last Exam (sans outils) | 43,6 |
| IFBench | 82,8 |
Source : fiche Qwen/Qwen3.8-2.4T-A95B, colonne « Qwen3.8-Max ». Ces scores sont ceux de l'éditeur, obtenus sous son propre banc ; ils se comparent entre eux, pas à ceux publiés ailleurs sous d'autres réglages.
Une annonce dans une course serrée
La preview arrive quelques jours après le lancement en poids ouverts de Kimi K3 par Moonshot. Le calendrier n'est pas anodin : les laboratoires chinois multiplient les annonces de modèles de pointe pour occuper le terrain et attirer les développeurs.
Teaser un modèle de 2 400 milliards de paramètres avant toute documentation relève autant de la communication que de la sortie produit.
Ce que l'on sait, ce que l'on ignore
Le tableau distingue ce qu'Alibaba annonçait le 19 juillet et ce que la fiche Hugging Face du modèle de base, relue le 1er septembre 2026, a publié depuis.
| Point | Annoncé en juillet 2026 | Publié depuis (fiche Hugging Face) |
|---|---|---|
| Nom | Qwen3.8-Max-Preview, preview live depuis le 19 juillet 2026 | Modèle de base Qwen3.8-2.4T-A95B, dépôt créé le 8 août 2026 ; Qwen3.8-Max en est « la version officielle » servie par l'API |
| Paramètres | 2 400 milliards, actifs non communiqués | 2 400 milliards dont 95 milliards actifs ; 512 experts, 10 routés + 1 partagé par token ; 92 couches |
| Modalités | Texte, image, vidéo, document | Modèle de base texte seul ; l'entrée image est réservée à la version Max de l'API |
| Contexte | Non communiqué | 262 144 tokens natifs, extensible à 1 010 000 selon la fiche ; 1 million par défaut sur l'API |
| Poids et licence | Non publiés, licence non annoncée | 4 892 Go de safetensors en BF16 ; licence « Qwen3.8-Max » : mention obligatoire au-delà de 100 millions d'utilisateurs mensuels, accord séparé pour un opérateur de modèle en service dépassant 50 M$ de chiffre d'affaires sur douze mois |
| Rapport technique | Aucun | Toujours aucun ; la fiche renvoie au billet de blog d'Alibaba |
| Benchmarks indépendants | Aucun | Le modèle figure à l'indice Artificial Analysis v4.1.1 (consulté le 1er septembre 2026) ; les scores de la fiche restent ceux d'Alibaba |
Qu’est-ce que Qwen3.8-Max-Preview change pour un déploiement local ?
La publication des poids change le statut du modèle, pas son échelle. Un modèle de 2 400 milliards de paramètres pèse 4 892 Go tel qu'il est publié en BF16, et environ 1 380 Go requantifié à 4 bits (calcul : 2 400 milliards × 0,5 octet, plus 15 % de marge).
Aucune machine à un nœud du catalogue ne l'accueille : la DGX Station GB300 plafonne à 748 Go. Il faut un cluster multi-GPU de plusieurs téraoctets de mémoire, ce qui reste hors de portée de la quasi-totalité des organisations. Pour l'immense majorité des usages, l'accès passe donc encore par l'API d'Alibaba, avec les questions de localisation et de contrôle des données que cela pose. Notre comparatif sur site ou API détaille cet arbitrage.
Ce qui change vraiment, c'est la lisibilité : les paramètres actifs, le contexte natif et la licence sont désormais publiés et vérifiables dans le dépôt, ce qui permet de dimensionner honnêtement au lieu de deviner. Une plateforme locale se construit sur des modèles dont la spécification est publiée et les poids téléchargeables, et qui tiennent sur la machine visée : la version se fige, le matériel se dimensionne au juste besoin et le comportement reste stable dans le temps. Notre comparatif des LLM open source recense ces modèles ; dans la gamme Qwen, Qwen3.8-27B (27 milliards de paramètres, Apache 2.0, 262 144 tokens) tient sur une seule carte, et Qwen3.8-Flash-Next sur un Mac Studio.
Questions fréquentes
Qu'est-ce que Qwen3.8-Max-Preview ?
Une preview du modèle haut de gamme d'Alibaba, présentée le 19 juillet 2026 : un modèle multimodal en mélange d'experts de 2 400 milliards de paramètres, accessible via l'API d'Alibaba. Depuis le 8 août 2026, le modèle de base Qwen3.8-2.4T-A95B (texte seul, 95 milliards de paramètres actifs) est publié sur Hugging Face ; Qwen3.8-Max en est la version servie par l'API, avec l'entrée image et un contexte d'un million de tokens par défaut.
Peut-on déployer Qwen3.8-Max en local ?
Le modèle de base Qwen3.8-2.4T-A95B, oui sur le papier : ses poids sont publics sous la licence Qwen3.8-Max, qui autorise l'usage commercial sous conditions. En pratique, 2 400 milliards de paramètres pèsent 4 892 Go en BF16 et environ 1 380 Go à 4 bits, ce qui dépasse toute machine à un nœud (748 Go pour une DGX Station GB300) et impose un cluster multi-GPU de plusieurs téraoctets. La version Max multimodale, elle, n'existe que sur l'API d'Alibaba.
Les chiffres annoncés par Alibaba sont-ils vérifiés ?
La taille l'est désormais : la fiche Hugging Face publie 2 400 milliards de paramètres dont 95 actifs, et le compteur du dépôt mesure 2 446 milliards d'éléments de tenseurs. Le positionnement face aux modèles concurrents repose toujours sur les scores publiés par Alibaba, sans rapport technique ; l'indice indépendant Artificial Analysis liste le modèle depuis août 2026.
Quels modèles Qwen se déploient sur site ?
Les modèles Qwen aux poids ouverts qui tiennent sur la machine visée : Qwen3.8-27B (27 milliards de paramètres, Apache 2.0, contexte 262 144 tokens) sur une seule carte GPU ou un poste de travail, Qwen3.8-Flash-Next sur un Mac Studio. Leur spécification est publiée, ce qui permet un dimensionnement précis du matériel et une plateforme stable dans le temps.
Choisir un modèle déployable chez vous
Un échange pour cadrer le bon modèle ouvert et le matériel qui va avec, sur votre site.
Réserver un échange