QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

Qwen3.8-Max-Preview : 2 400 milliards de paramètres, et des questions

Alibaba a teasé en juillet un modèle multimodal géant, quelques jours après la sortie de Kimi K3, sans rapport technique ni banc d'essai indépendant. Depuis le 8 août 2026, les poids du modèle de base sont publics sur Hugging Face. Voici ce que l'on savait, ce qui a été publié depuis, et ce que cela change pour un déploiement local.

Mis à jour le 1er septembre 2026 : le modèle de base Qwen/Qwen3.8-2.4T-A95B est public sur Hugging Face depuis le 8 août 2026 (2 400 milliards de paramètres, 95 milliards actifs, licence Qwen3.8-Max). Les passages qui affirmaient que les poids n'étaient pas publiés sont corrigés ; la version Max multimodale reste servie par l'API.

Une puce colossale faite de milliers de petites tuiles dont quelques-unes seulement sont allumées, vue à travers une loupe.
Réponse courte. Alibaba a présenté le 19 juillet 2026 une preview de Qwen3.8-Max, un modèle multimodal en mélange d'experts annoncé à 2 400 milliards de paramètres, accessible via son API. Depuis le 8 août 2026, le modèle de base Qwen3.8-2.4T-A95B est public sur Hugging Face : 2 400 milliards de paramètres dont 95 milliards actifs, contexte natif de 262 144 tokens, 4 892 Go de poids en BF16, texte seul, licence « Qwen3.8-Max » à conditions. La version Max multimodale, avec un contexte d'un million de tokens par défaut, reste servie par l'API d'Alibaba. Un déploiement sur site est donc possible sur le papier, mais il demande une machine multi-GPU de plusieurs téraoctets de mémoire, hors de portée de la quasi-totalité des organisations. Pour une plateforme locale, la gamme utile reste Qwen3.8-27B.

De quoi parle-t-on ?

Le 19 juillet 2026, l'équipe Qwen d'Alibaba a présenté Qwen3.8-Max-Preview, la nouvelle itération de sa gamme « Max ». Le modèle traiterait texte, images, vidéo et documents. Alibaba avance une taille de 2 400 milliards de paramètres et un positionnement juste derrière les meilleurs modèles du marché sur ses propres évaluations.

La preview est ouverte aux développeurs à 10 % du tarif standard via le Token Plan, et la version complète est promise sans échéance.

Chaque chiffre demande de la prudence : il s'agit d'une annonce commerciale et non d'une publication scientifique, aucun rapport technique n'accompagnant la préversion, et aucune équipe indépendante n'a pu mesurer le modèle.

Un mélange d'experts à très grande échelle

Comme les précédents modèles « Max », l'architecture repose sur un mélange d'experts clairsemé : le réseau contient un grand nombre d'experts, et un routeur n'en active qu'une petite fraction à chaque token. On obtient la capacité d'un modèle géant pour un coût de calcul par requête inférieur.

Les modèles ouverts que nous déployons, comme DeepSeek V4, Kimi K3 ou MiniMax M3, suivent le même principe à une échelle documentée.

Le nombre de paramètres actifs de Qwen3.8-Max n'avait pas été communiqué en juillet ; la fiche Hugging Face publiée en août le donne : 95 milliards actifs sur 2 400, avec 512 experts dont 10 routés et 1 partagé actifs à chaque token. C'est l'information qui détermine le coût réel d'inférence, la latence et le dimensionnement mémoire. Notre guide sur le matériel d'inférence détaille pourquoi ce chiffre commande tout le reste.

Des chiffres de performance à manier avec prudence

Aucun tableau de benchmark n'accompagnait la preview de juillet. La fiche Hugging Face du modèle de base, relue le 2 septembre 2026, en publie un pour Qwen3.8-Max, établi par Alibaba et non reproduit par un tiers ; en voici six lignes, dont le score Terminal Bench 2.1 est mesuré avec Claude Code (moyenne de dix passages, délai de cinq heures).

BenchmarkScore Qwen3.8-Max (fiche de l'éditeur)
Terminal Bench 2.186,6
SWE-bench Pro67,7
Toolathlon Verified (Pass@1)72,5
GPQA Diamond92,6
Humanity's Last Exam (sans outils)43,6
IFBench82,8

Source : fiche Qwen/Qwen3.8-2.4T-A95B, colonne « Qwen3.8-Max ». Ces scores sont ceux de l'éditeur, obtenus sous son propre banc ; ils se comparent entre eux, pas à ceux publiés ailleurs sous d'autres réglages.

Une annonce dans une course serrée

La preview arrive quelques jours après le lancement en poids ouverts de Kimi K3 par Moonshot. Le calendrier n'est pas anodin : les laboratoires chinois multiplient les annonces de modèles de pointe pour occuper le terrain et attirer les développeurs.

Teaser un modèle de 2 400 milliards de paramètres avant toute documentation relève autant de la communication que de la sortie produit.

Ce que l'on sait, ce que l'on ignore

Le tableau distingue ce qu'Alibaba annonçait le 19 juillet et ce que la fiche Hugging Face du modèle de base, relue le 1er septembre 2026, a publié depuis.

PointAnnoncé en juillet 2026Publié depuis (fiche Hugging Face)
NomQwen3.8-Max-Preview, preview live depuis le 19 juillet 2026Modèle de base Qwen3.8-2.4T-A95B, dépôt créé le 8 août 2026 ; Qwen3.8-Max en est « la version officielle » servie par l'API
Paramètres2 400 milliards, actifs non communiqués2 400 milliards dont 95 milliards actifs ; 512 experts, 10 routés + 1 partagé par token ; 92 couches
ModalitésTexte, image, vidéo, documentModèle de base texte seul ; l'entrée image est réservée à la version Max de l'API
ContexteNon communiqué262 144 tokens natifs, extensible à 1 010 000 selon la fiche ; 1 million par défaut sur l'API
Poids et licenceNon publiés, licence non annoncée4 892 Go de safetensors en BF16 ; licence « Qwen3.8-Max » : mention obligatoire au-delà de 100 millions d'utilisateurs mensuels, accord séparé pour un opérateur de modèle en service dépassant 50 M$ de chiffre d'affaires sur douze mois
Rapport techniqueAucunToujours aucun ; la fiche renvoie au billet de blog d'Alibaba
Benchmarks indépendantsAucunLe modèle figure à l'indice Artificial Analysis v4.1.1 (consulté le 1er septembre 2026) ; les scores de la fiche restent ceux d'Alibaba

Qu’est-ce que Qwen3.8-Max-Preview change pour un déploiement local ?

La publication des poids change le statut du modèle, pas son échelle. Un modèle de 2 400 milliards de paramètres pèse 4 892 Go tel qu'il est publié en BF16, et environ 1 380 Go requantifié à 4 bits (calcul : 2 400 milliards × 0,5 octet, plus 15 % de marge).

Aucune machine à un nœud du catalogue ne l'accueille : la DGX Station GB300 plafonne à 748 Go. Il faut un cluster multi-GPU de plusieurs téraoctets de mémoire, ce qui reste hors de portée de la quasi-totalité des organisations. Pour l'immense majorité des usages, l'accès passe donc encore par l'API d'Alibaba, avec les questions de localisation et de contrôle des données que cela pose. Notre comparatif sur site ou API détaille cet arbitrage.

Ce qui change vraiment, c'est la lisibilité : les paramètres actifs, le contexte natif et la licence sont désormais publiés et vérifiables dans le dépôt, ce qui permet de dimensionner honnêtement au lieu de deviner. Une plateforme locale se construit sur des modèles dont la spécification est publiée et les poids téléchargeables, et qui tiennent sur la machine visée : la version se fige, le matériel se dimensionne au juste besoin et le comportement reste stable dans le temps. Notre comparatif des LLM open source recense ces modèles ; dans la gamme Qwen, Qwen3.8-27B (27 milliards de paramètres, Apache 2.0, 262 144 tokens) tient sur une seule carte, et Qwen3.8-Flash-Next sur un Mac Studio.

Questions fréquentes

Qu'est-ce que Qwen3.8-Max-Preview ?

Une preview du modèle haut de gamme d'Alibaba, présentée le 19 juillet 2026 : un modèle multimodal en mélange d'experts de 2 400 milliards de paramètres, accessible via l'API d'Alibaba. Depuis le 8 août 2026, le modèle de base Qwen3.8-2.4T-A95B (texte seul, 95 milliards de paramètres actifs) est publié sur Hugging Face ; Qwen3.8-Max en est la version servie par l'API, avec l'entrée image et un contexte d'un million de tokens par défaut.

Peut-on déployer Qwen3.8-Max en local ?

Le modèle de base Qwen3.8-2.4T-A95B, oui sur le papier : ses poids sont publics sous la licence Qwen3.8-Max, qui autorise l'usage commercial sous conditions. En pratique, 2 400 milliards de paramètres pèsent 4 892 Go en BF16 et environ 1 380 Go à 4 bits, ce qui dépasse toute machine à un nœud (748 Go pour une DGX Station GB300) et impose un cluster multi-GPU de plusieurs téraoctets. La version Max multimodale, elle, n'existe que sur l'API d'Alibaba.

Les chiffres annoncés par Alibaba sont-ils vérifiés ?

La taille l'est désormais : la fiche Hugging Face publie 2 400 milliards de paramètres dont 95 actifs, et le compteur du dépôt mesure 2 446 milliards d'éléments de tenseurs. Le positionnement face aux modèles concurrents repose toujours sur les scores publiés par Alibaba, sans rapport technique ; l'indice indépendant Artificial Analysis liste le modèle depuis août 2026.

Quels modèles Qwen se déploient sur site ?

Les modèles Qwen aux poids ouverts qui tiennent sur la machine visée : Qwen3.8-27B (27 milliards de paramètres, Apache 2.0, contexte 262 144 tokens) sur une seule carte GPU ou un poste de travail, Qwen3.8-Flash-Next sur un Mac Studio. Leur spécification est publiée, ce qui permet un dimensionnement précis du matériel et une plateforme stable dans le temps.

Choisir un modèle déployable chez vous

Un échange pour cadrer le bon modèle ouvert et le matériel qui va avec, sur votre site.

Réserver un échange

Références