GLM 5.2
Z.AI

GLM 5.2 occupe la première place des modèles ouverts sur l’indice d’intelligence. Cette architecture à mélange d’experts totalise 744 milliards de paramètres et vise le raisonnement, l’agentique et le code. Sa tendance à raisonner longuement demande une surveillance des tokens de sortie.
Points clés : Premier en qualité · Mélange d’experts 744 Md · Raisonnement et code · Agentique · Poids ouverts.
Architecture
GLM 5.2 est un modèle à mélange d’experts de 744 milliards de paramètres. Seule une fraction des experts s’active par token, ce qui contient le coût de calcul à l’inférence.
Points forts
Le modèle occupe la première place des modèles ouverts sur l’indice d’intelligence. Il vise le raisonnement, l’agentique et la génération de code.
Cas d’usage
GLM 5.2 sert les tâches exigeantes de raisonnement et de code. Sa tendance à raisonner longuement demande une surveillance des tokens de sortie pour maîtriser le coût.
Déploiement
Servi par vLLM sur serveur GPU, ou par llama.cpp quantifié. Il constitue, avec DeepSeek V4, le socle de la pile dwarfstar.
Tous les modèles de la plateforme sont interchangeables via une passerelle unique : changer de modèle revient à changer une ligne de configuration, sans réécrire le code. La priorité reste l’exécution locale.
Sur quelle machine faire tourner GLM 5.2 ?
GLM 5.2 totalise 744 milliards de paramètres, soit environ 428 Go en NVFP4. 7 plateformes du catalogue disposent d’assez de mémoire.
- GLM 5.2 sur Mac Studio Ultra
- GLM 5.2 sur DGX Station
- GLM 5.2 sur Serveur RTX PRO 6000
- GLM 5.2 sur Serveur H200 SXM
- GLM 5.2 sur B200 SXM
- GLM 5.2 sur B300 SXM
- GLM 5.2 sur GB300 NVL72
Voir aussi GLM 5.2 en NVFP4 et la matrice complète.