QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

Qwen 3.8 et Gemma 4

Alibaba et Google

Qwen 3.8 et Gemma 4

Qwen 3.8 et Gemma 4 constituent les modèles compacts. Qwen 3.8 27B et Gemma 4, de 4 à 31 milliards de paramètres, s’exécutent sur une seule carte, un poste ou en périphérie. Ils conviennent aux TPE.

Qwen3.8-27B, publié le 13 août 2026 sous licence Apache 2.0, apporte deux changements structurants pour un déploiement sur site : un contexte natif de 262 144 tokens (extensible à 1 million via YaRN) et une architecture hybride, 48 couches en attention linéaire Gated DeltaNet, 16 seulement en attention complète, qui réduit le cache KV à 64 Kio par token en FP16, quatre fois moins qu’un modèle dense classique équivalent. Le détail et le dimensionnement matériel font l’objet d’un article dédié.

Points clés : Compacts · Qwen 3.8 27B et Gemma 4 · Une seule carte · Périphérie · TPE.

Architecture

Qwen 3.8 27B et Gemma 4, de 4 à 31 milliards de paramètres, constituent les modèles compacts de la plateforme.

Points forts

Ils s’exécutent sur une seule carte, un poste ou en périphérie, avec une empreinte mémoire réduite.

Cas d’usage

Ces modèles conviennent aux TPE, aux usages embarqués et aux tâches où la latence locale et le coût priment sur la puissance brute.

Déploiement

Servis par llama.cpp ou vLLM sur DGX Spark, Mac Studio ou une seule carte GPU.

Et Qwen3.8-Max-Preview ?

Alibaba a présenté le 19 juillet 2026 une preview de Qwen3.8-Max, un modèle multimodal en mélange d'experts annoncé à 2 400 milliards de paramètres. L'annonce ne s'accompagne d'aucun rapport technique, d'aucune fiche de modèle, d'aucune licence ni d'aucun benchmark indépendant, et le nombre de paramètres actifs n'est pas publié. L'accès passe par l'API d'Alibaba, ce qui pose les questions de localisation des données qu'une plateforme locale évite. Ce modèle ne se déploie pas sur site. La gamme retenue ici reste Qwen 3.8, dont la spécification est publiée et les poids téléchargeables.

Tous les modèles de la plateforme sont interchangeables via une passerelle unique : changer de modèle revient à changer une ligne de configuration, sans réécrire le code. La priorité reste l’exécution locale.

La variante Qwen3-Embedding-4B, servie en FP8 par vLLM sur une RTX 5080, a été mesurée en conditions réelles le 31 juillet 2026 : 14 100 tok/s en plateau et 19 075 tok/s sur texte long, avec la procédure complète dans la page de mesures de la section mesures.

Déployer ce modèle chez vous

Sur votre matériel, sans que vos données sortent.

Réserver un échange

Sur quelle machine faire tourner Qwen 3.8 27B ?

Qwen 3.8 27B totalise 27 milliards de paramètres, soit environ 15,5 Go en NVFP4. 8 plateformes du catalogue disposent d’assez de mémoire.

Voir aussi Qwen 3.8 27B en NVFP4 et la matrice complète.