QDNAVente et intégration de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

Qwen3.8-Max-Preview : 2 400 milliards de paramètres, et des questions

Alibaba tease un modèle multimodal géant, quelques jours après la sortie de Kimi K3. Derrière l'annonce, aucun rapport technique ni benchmark indépendant. Voici ce que l'on sait, et ce que cela change pour un déploiement local.

Qwen3.8-Max-Preview : 2 400 milliards de paramètres, et des questions
Réponse courte. Alibaba a présenté le 19 juillet 2026 une preview de Qwen3.8-Max, un modèle multimodal en mélange d'experts annoncé à 2 400 milliards de paramètres, accessible via son API à tarif réduit. L'annonce ne fournit ni rapport technique, ni fiche de modèle, ni licence, ni benchmark indépendant. Ce modèle ne se déploie pas sur site. Pour une plateforme locale, la gamme utile reste celle des modèles aux poids téléchargeables, comme Qwen 3.6.

De quoi parle-t-on ?

Le 19 juillet 2026, l'équipe Qwen d'Alibaba a présenté Qwen3.8-Max-Preview, la nouvelle itération de sa gamme « Max ». Le modèle traiterait texte, images, vidéo et documents. Alibaba avance une taille de 2 400 milliards de paramètres et un positionnement juste derrière les meilleurs modèles du marché sur ses propres évaluations. La preview est ouverte aux développeurs à dix pour cent du tarif standard via le Token Plan, et la version complète est promise sans échéance.

Chaque chiffre demande de la prudence : il s'agit d'une annonce commerciale, pas d'une publication scientifique. Aucun rapport technique n'accompagne la preview, et aucune équipe indépendante n'a pu mesurer le modèle.

Un mélange d'experts à très grande échelle

Comme les précédents modèles « Max », l'architecture repose sur un mélange d'experts clairsemé : le réseau contient un grand nombre d'experts, et un routeur n'en active qu'une petite fraction à chaque jeton. On obtient la capacité d'un modèle géant pour un coût de calcul par requête inférieur. Les modèles ouverts que nous déployons, comme DeepSeek V4, Kimi K3 ou MiniMax M3, suivent le même principe à une échelle documentée.

Le nombre de paramètres actifs de Qwen3.8-Max n'a pas été communiqué. C'est pourtant l'information qui détermine le coût réel d'inférence, la latence et le dimensionnement mémoire. Notre guide sur le matériel d'inférence détaille pourquoi ce chiffre commande tout le reste.

Des chiffres de performance à manier avec prudence

Aucun tableau de benchmark n'accompagne la preview. Les chiffres publics disponibles portent sur la génération précédente, Qwen3-Max, et proviennent du blog d'Alibaba. Ils omettent plusieurs concurrents directs, ce qui interdit une comparaison honnête.

BenchmarkScore Qwen3-Max (génération précédente)
MMLU-Pro76,0
GPQA71,9
AIME (mathématiques)80,0
LiveCodeBench v574,1

Source : blog Alibaba. Le chiffre SWE-bench publié au lancement de Qwen3-Max a depuis été retiré du blog officiel, ce qui invite à la réserve sur les scores restants.

Une annonce dans une course serrée

La preview arrive quelques jours après le lancement en poids ouverts de Kimi K3 par Moonshot. Le calendrier n'est pas anodin : les laboratoires chinois multiplient les annonces de modèles de pointe pour occuper le terrain et attirer les développeurs. Teaser un modèle de 2 400 milliards de paramètres avant toute documentation relève autant de la communication que de la sortie produit.

Ce que l'on sait, ce que l'on ignore

Connu (annoncé)Inconnu (non publié)
Nom : Qwen3.8-Max-PreviewParamètres actifs et nombre d'experts
Preview live depuis le 19 juillet 2026Rapport technique et fiche de modèle
Multimodal : texte, image, vidéo, documentLicence et disponibilité des poids
Accès à 10 % du tarif via le Token PlanBenchmarks indépendants et longueur de contexte

Ce que cela change pour un déploiement local

Un modèle de 2 400 milliards de paramètres reste inexploitable sur site pour la quasi-totalité des organisations, et les poids ne sont de toute façon pas publiés. L'accès passe par l'API d'Alibaba, avec les questions de localisation et de contrôle des données que cela pose. Notre comparatif sur site ou API détaille cet arbitrage.

Une plateforme locale se construit sur des modèles dont la spécification est publiée et les poids téléchargeables : la version se fige, le matériel se dimensionne au juste besoin et le comportement reste stable dans le temps. Notre comparatif des LLM open source recense ces modèles, et la fiche Qwen 3.6 couvre la gamme Qwen réellement déployable. Une annonce spectaculaire ne change pas ce critère : sans poids ni documentation, un modèle n'entre pas dans une architecture d'entreprise.

Questions fréquentes

Qu'est-ce que Qwen3.8-Max-Preview ?

Une preview du prochain modèle haut de gamme d'Alibaba, présentée le 19 juillet 2026. Alibaba annonce un modèle multimodal en mélange d'experts de 2 400 milliards de paramètres, accessible via son API à tarif réduit. La version complète n'a pas de date de sortie.

Peut-on déployer Qwen3.8-Max en local ?

Non. Les poids ne sont pas publiés, la licence n'est pas annoncée et une taille de 2 400 milliards de paramètres dépasse l'infrastructure de la quasi-totalité des organisations. L'accès passe par l'API d'Alibaba, avec les questions de localisation des données que cela pose.

Les chiffres annoncés par Alibaba sont-ils vérifiés ?

Non. La preview n'est accompagnée d'aucun rapport technique, d'aucune fiche de modèle et d'aucun benchmark indépendant. La taille de 2 400 milliards de paramètres et le positionnement face aux modèles concurrents reposent sur les seules affirmations d'Alibaba.

Quels modèles Qwen se déploient sur site ?

Les modèles Qwen aux poids ouverts, comme Qwen 3.6, se téléchargent et s'exécutent sur une seule carte GPU ou un poste de travail. Leur spécification est publiée, ce qui permet un dimensionnement précis du matériel et une plateforme stable dans le temps.

Choisir un modèle déployable chez vous

Un échange pour cadrer le bon modèle ouvert et le matériel qui va avec, sur votre site.

Réserver un échange

Références