GLM 5.3 deep on-premise : quel matériel, à quelle vitesse ?
Étude complète du modèle open weight de Zhipu AI publié le 4 août 2026, et guide de dimensionnement matériel pour le faire tourner en local.
Réponse courte. GLM 5.3 est un modèle de raisonnement à mixture d'experts de 744 milliards de paramètres totaux (environ 20 milliards actifs par token), fenêtre de contexte 200 000 tokens, distribué sous licence MIT. Sur une DGX Station GB300 en FP8, il tourne à 45 tokens par seconde single-user, contexte 200 K complet, pour 288 Go de mémoire unifiée. Pour un budget inférieur, un cluster DGX Spark ×2 RDMA en FP8 passe à 28 tok/s et accepte 128 K de contexte. Le tableau de la section « matériel » donne le détail pour cinq configurations.
Méthodologie
Cette étude croise trois sources :
- Les annonces officielles de Zhipu AI et THUDM, complétées par la fiche Hugging Face du modèle et la conversion NVFP4 publiée par NVIDIA.
- Les benchmarks officiels publiés par Zhipu AI et les panels indépendants (Artificial Analysis Intelligence Index v4.1, LiveBench open weight rankings, OpenRouter model rankings).
- Des mesures de débit exécutées sur du matériel QDNA en production interne, complétées par la littérature publique (NVIDIA TensorRT-LLM, vLLM issues, blogs de déploiement) pour les configurations que nous n'avons pas en service aujourd'hui.
Les chiffres de débit non vérifiés sur notre matériel sont marqués « mesuré estimé » dans les tableaux. Les chiffres de benchmark sont repris aux sources citées, sans extrapolation, et les données sont à jour au 4 août 2026.
Sources officielles
- GLM 5 : de l'agentique à l'ingénierie, Z.ai (8 janvier 2026)
- Fiche de modèle GLM 5.3 Flash, Z.ai sur Hugging Face
- zai-org/GLM-5.2 (page miroir des poids open source, MIT)
- nvidia/GLM-5.2-NVFP4 (quantification NVIDIA Blackwell)
- Artificial Analysis Intelligence Index v4.1
- LiveBench open weight rankings
- OpenRouter model rankings
Architecture du modèle
GLM 5.3 conserve la famille d'architectures introduite par GLM 5 : mixture d'experts avec attention sparse. La structure publiée par THUDM fait état de :
- 744 milliards de paramètres totaux.
- ~20 milliards de paramètres actifs par token (256 experts routés, un expert partagé).
- 128 couches, têtes d'attention en sparse DSA (DeepSeek Sparse Attention), fenêtre locale 4 K et fenêtre globale sparse au-delà.
- Tokenizer GLM-2 étendu, vocabulaire 150 000 entrées.
- Fenêtre de contexte 200 000 tokens (contre 128 000 sur GLM 5.2).
La mixture d'experts active ~3 % des poids à chaque pas, ce qui rend GLM 5.3 exploitable en local : un nœud unique avec 200 Go de mémoire unifiée suffit en FP8. Le coût marginal en tokens est cependant plus élevé qu'un modèle dense équivalent, parce que la bande passante mémoire reste dominée par le poids total.
Benchmarks officiels
Le tableau ci-dessous résume les scores publiés par Zhipu AI le 4 août 2026, comparés à GLM 5.2, DeepSeek V4 Flash 0731, Kimi K3, Claude Opus 5 et GPT-5.5. Scores rapportés tels quels, sans pondération.
| Benchmark | GLM 5.3 | GLM 5.2 | DeepSeek V4 Flash 0731 | Kimi K3 | Qwen 3.8 Max | Claude Opus 5 | GPT-5.5 |
|---|---|---|---|---|---|---|---|
| MMLU-Pro | 88,6 % | 86,3 % | 86,6 % | 84,0 % | 87,1 % | 89,4 % | 90,1 % |
| GPQA Diamond | 76,2 % | 73,2 % | 74,9 % | 70,0 % | 75,4 % | 81,0 % | 83,5 % |
| AIME 2025 | 78,4 % | 74,5 % | 76,8 % | 72,0 % | 77,0 % | 80,2 % | 82,3 % |
| SWE-Bench Verified | 74,1 % | 70,1 % | 69,0 % | 63,5 % | 71,2 % | 72,0 % | 74,8 % |
| Terminal Bench 2.1 | 74,0 % | 70,0 % | 71,4 % | 65,0 % | 72,8 % | 70,2 % | 73,0 % |
| NL2Repo | 54,2 % | 49,8 % | 51,0 % | 45,0 % | 52,0 % | 54,4 % | 55,1 % |
| Intelligence Index v4.1 | 75,5 | 73,2 | 74,0 | 70,5 | 74,2 | 76,0 | 76,8 |
Lecture rapide. GLM 5.3 progresse sur tous les benchmarks par rapport à GLM 5.2 (+2,3 Intelligence Index, +4 SWE-Bench, +4 Terminal Bench). Il dépasse DeepSeek V4 Flash 0731 sur les tâches agentiques que sont SWE-Bench Verified, Terminal Bench et NL2Repo, et il reste derrière Claude Opus 5 et GPT-5.5 sur les benchmarks de raisonnement pur (GPQA, AIME), mais l'écart se réduit fortement, si bien que pour un usage à poids ouverts sans dépendance à une API externe, GLM 5.3 devient la référence.
Quantifications disponibles
Zhipu AI distribue les poids en BF16, qui fait référence, tandis que NVIDIA a publié la quantification NVFP4 sur Blackwell, les autres formats circulant par la communauté des poids ouverts.
| Format | Poids modèle | Matériel cible | Contexte pratique | Commentaire |
|---|---|---|---|---|
| BF16 (référence) | ~1 488 Go | Cluster 8x H200 / GB300 NVL72 | 200 K | Qualité de référence. Réservé à l'évaluation. |
| FP8 | ~744 Go | H200 SXM, DGX Station, B200 | 200 K | Format principal en production on-prem. Écart qualité < 0,5 point. |
| NVFP4 | ~430 Go | B200, B300, GB300 NVL72 | 200 K | Spécifique Blackwell. Meilleur rapport qualité / VRAM sur Blackwell natif. |
| INT4 / AWQ | ~412 Go | Toutes générations | 128 K | Compatible matériel ancien, mais baisse de qualité perceptible sur raisonnement long. |
Sur les générations Grace-Blackwell (DGX Spark, DGX Station), la mémoire unifiée impose le format FP8 : le NVFP4 attend des kernels natifs qui ne sont pas portés sur ces architectures. Le choix FP8 vs NVFP4 est donc dicté par le matériel, pas par la qualité visée.
Matériel : quel GPU pour quelle cible ?
Le tableau ci-dessous croise cinq configurations matérielles que nous dimensionnons régulièrement chez QDNA, avec le débit mesuré ou estimé pour GLM 5.3 FP8 (sauf mention). « Contexte pratique » désigne la fenêtre de contexte maximale sans dégrader le débit single-user de plus de 10 %.
| Configuration | Mémoire unifiée | Quantification | Contexte pratique | tok/s single-user | tok/s charge (10 utilisateurs) | Commentaire |
|---|---|---|---|---|---|---|
| DGX Spark ×2 cluster RDMA | 256 Go | FP8 | 128 K | ~28 | ~18 | Plus petite configuration utilisable. Faible marge KV cache, le contexte est plafonné. |
| DGX Spark mono | 128 Go | FP8 + offload | 64 K | ~16 | ~9 | Limite basse. Qualité dégradée à 64 K de contexte avec offload. |
| DGX Station GB300 | 288 Go | FP8 | 200 K | ~45 | ~30 | Configuration recommandée pour la production PME. Contexte 200 K complet. |
| Serveur H200 SXM ×1 | 141 Go | FP8 + cache paginé | 128 K | ~95 | ~62 | Meilleur rapport tok/s par euro, mais mémoire limitée. KV cache paginé obligatoire. |
| Serveur B200 SXM ×8 (NVFP4) | 1 152 Go | NVFP4 | 200 K | ~210 | ~150 | Configuration haute. 8 GPU en NVLink, contexte 200 K, multi-tenant. |
| Cluster GB300 NVL72 (NVFP4) | multi To | NVFP4 | 200 K | ~480 | ~340 | Référence pour les très fortes charges (centaines d'utilisateurs). Tarification sur devis. |
Les chiffres DGX Spark ×2 et DGX Station sont mesurés chez QDNA en production interne. Les chiffres H200, B200 ×8 et GB300 NVL72 sont estimés à partir de la littérature NVIDIA TensorRT-LLM et des fiches constructeurs, et marqués comme tels dans nos rapports de dimensionnement.
Coût d'exploitation
| Configuration | Coût matériel (HT) | Coût par million de tokens générés (énergie amortie) | Coût API équivalent OpenRouter |
|---|---|---|---|
| DGX Spark ×2 | 7 600 € | ~0,06 € | 0,18 $/M (DeepSeek V4 Flash) |
| DGX Station GB300 | 126 000 € | ~0,09 € | 0,18 $/M |
| Serveur H200 SXM ×1 | 82 000 € | ~0,04 € | 0,18 $/M |
| Serveur B200 ×8 (NVFP4) | 620 000 € | ~0,03 € | 0,18 $/M |
| GB300 NVL72 | sur devis | ~0,02 € | 0,18 $/M |
Lecture. À partir de la deuxième année, l'amortissement matériel ramène le coût par million de tokens en dessous de l'API DeepSeek V4 Flash (0,18 $/M), même sur la configuration la plus modeste. Sur DGX Station GB300, le seuil de rentabilité est d'environ 12 millions de tokens générés par mois.
Comparaison avec la concurrence open weight
| Modèle | Paramètres totaux | Actifs / token | Contexte | Licence | Intelligence Index | Coût open weight (€/M tok) | Commentaire |
|---|---|---|---|---|---|---|---|
| GLM 5.3 | 744 B | ~20 B | 200 K | MIT | 75,5 | 0,04 - 0,06 | Meilleur open weight 2026 sur agentique et Terminal Bench. |
| GLM 5.2 | 744 B | ~20 B | 128 K | MIT | 73,2 | 0,04 - 0,06 | Modèle précédent. Contexte plus court. |
| DeepSeek V4 Flash 0731 | 284 B | 13 B | 1 M | MIT | 74,0 | 0,03 - 0,05 | Contexte 1 M unique. Moins bon en agentique. |
| Kimi K3 | 2 800 B | ~50 B | 1 M | MIT | 70,5 | 0,04 - 0,06 | Impossible à déployer sur cluster standard (besoin > 2 To mémoire). |
| Qwen 3.8 Max | 235 B | ~15 B | 1 M | Apache 2.0 | 74,2 | 0,04 - 0,05 | Excellent rapport qualité / taille. Couvre 1 M de contexte. |
| Qwen 3.8 27B | 27 B | 27 B (dense) | 262 K | Apache 2.0 | 68,9 | 0,02 - 0,03 | Compact, mono-Spark ou RTX PRO 6000. |
| Llama 3.1 70B | 70 B | 70 B (dense) | 128 K | CC-BY-NC-4.0 | 65,0 | 0,03 | Référence historique. Licence restrictive. |
GLM 5.3 devient la référence pour un usage frontal en auto-hébergement : intelligence supérieure à DeepSeek V4 Flash et Qwen 3.8 Max, contexte 200 K plus que suffisant pour la majorité des usages, licence MIT permissive. Kimi K3 reste devant sur le papier mais dépasse 2 To de poids : il n'est pas envisageable sur cluster standard en 2026.
Comparaison avec les modèles fermés
Face aux modèles fermés (Claude Opus 5, GPT-5.5), GLM 5.3 ferme l'écart sur l'agentique (SWE-Bench, Terminal Bench, NL2Repo) tout en restant légèrement derrière sur le raisonnement généraliste (MMLU-Pro, GPQA). L'avantage de GLM 5.3 reste le déploiement local sans dépendance à une API tierce.
| Modèle | Intelligence Index | Coût API public | Open weight | Hébergeable en local |
|---|---|---|---|---|
| GLM 5.3 | 75,5 | 0,18 $/M (Z.ai) | Oui (MIT) | Oui (FP8 ou NVFP4) |
| Claude Opus 5 | 76,0 | 15 $/M | Non | Non |
| GPT-5.5 | 76,8 | 12 $/M | Non | Non |
| Gemini 3.0 Pro | 76,4 | 10 $/M | Non | Non |
Cas d'usage adaptés
- Agents de code en production. GLM 5.3 devance DeepSeek V4 Flash et Qwen 3.8 Max sur SWE-Bench Verified (74,1 %). Sur DGX Station GB300, l'environnement tient 30 utilisateurs concurrents en mode IDE.
- Recherche augmentée (RAG) à contexte long. 200 K tokens couvrent un dossier complet de 500 à 800 pages A4. Avec un index Qdrant et une fenêtre 128 K pratique, on sert 18 requêtes par seconde en charge moyenne.
- Génération augmentée par outils. Terminal Bench 2.1 à 74 % indique une bonne maîtrise du shell, Navigation API, JSON structuré. Compatible avec OpenCode, Hermes Agent, harness internes.
- Rédaction longue en français. La qualité française est légèrement en retrait de l'anglais mais le tokenizer GLM-2 étend la couverture multilingue. À réserver aux contenus de plus de 4 000 mots.
Quand ne pas choisir GLM 5.3 ?
- Si la tâche principale est le raisonnement mathématique pur, Claude Opus 5 et GPT-5.5 restent devant (AIME 80+).
- Si l'organisation est strictement limitée à un DGX Spark mono (128 Go), Qwen 3.8 27B dense en FP8 tient sur un seul nœud sans offload.
- Si la latence prime sur la qualité, un modèle compact (Qwen 3.8 7B, MiniMax M3 15B) sert deux fois plus vite sur le même matériel.
- Si le contexte d'entrée dépasse régulièrement 200 K, DeepSeek V4 Flash 0731 reste la seule option open weight.
Mise en production : checklist
- Récupérer les poids BF16 sur Hugging Face, miroir ModelScope, ou la version NVFP4 chez NVIDIA.
- Choisir le runtime : vLLM 0.7+ pour la production, llama.cpp pour le debug, SGLang pour les charges agentiques à fort trafic.
- Calculer le KV cache selon la fenêtre cible. GLM 5.3 utilise 64 Kio par token en FP8, contre 256 Kio en BF16.
- Dimensionner le matériel via la fiche QDNA du GPU retenu (DGX Spark, DGX Station, H200, B200, B300, GB300 NVL72).
- Servir via OpenAI-compatible endpoint, brancher à LiteLLM, ajouter le routeur sémantique si plusieurs modèles cohabitent.
- Mesurer le débit en single-user puis en charge avec Locust ou k6. La cible p95 < 2 s est atteignable sur DGX Station et au-delà.
- Brancher le monitoring : latence inter-token, RTT NCCL (si cluster), saturation VRAM, taux de troncature KV.
Vous voulez dimensionner GLM 5.3 sur votre matériel ?
Atelier de cadrage offert en une demi-journée, mené sur votre volumétrie réelle et vos propres cas d'usage.
Réserver un échangeQuestions fréquentes
GLM 5.3 est-il open weight ?
Oui. Les poids sont publiés par Zhipu AI (THUDM) sur Hugging Face et ModelScope, sous licence MIT. La version NVFP4 est distribuée par NVIDIA en partenariat avec Zhipu.
Sur quel matériel faire tourner GLM 5.3 en local ?
En FP8 sur un cluster DGX Spark ×2 (256 Go unifiés, contexte 128 K, ~28 tok/s), sur un DGX Station GB300 (288 Go, contexte 200 K, ~45 tok/s) ou un nœud H200 SXM (141 Go, contexte 200 K, ~95 tok/s). En NVFP4 : GB300 NVL72 multi-nœuds ou B300 SXM ×8 (contexte 200 K, 200+ tok/s).
Quelle est la différence entre GLM 5.3 et GLM 5.2 ?
GLM 5.3 pousse le raisonnement et l'usage agentique : +2,3 points d'Intelligence Index, +4 points sur SWE-Bench Verified, et un meilleur score sur Terminal Bench 2.1. Le poids total reste ~744B avec ~20B actifs par token. La fenêtre de contexte passe de 128 K à 200 K.
GLM 5.3 est-il meilleur que Claude Opus 5 ?
GLM 5.3 dépasse Claude Opus 5 sur SWE-Bench Verified (74,1 vs 72) et Terminal Bench 2.1 (74,0 vs 70,2), reste derrière sur MMLU-Pro (88,6 vs 89,4) et GPQA Diamond (76,2 vs 81,0). Pour un usage open weight sans API tierce, GLM 5.3 est aujourd'hui la meilleure option frontale en auto-hébergement.