QDNA

GLM 5.3 deep on-premise : quel matériel, à quelle vitesse ?

Étude complète du modèle open weight de Zhipu AI publié le 4 août 2026, et guide de dimensionnement matériel pour le faire tourner en local.

Réponse courte. GLM 5.3 est un modèle de raisonnement à mixture d'experts de 744 milliards de paramètres totaux (environ 20 milliards actifs par token), fenêtre de contexte 200 000 tokens, distribué sous licence MIT. Sur une DGX Station GB300 en FP8, il tourne à 45 tokens par seconde single-user, contexte 200 K complet, pour 288 Go de mémoire unifiée. Pour un budget inférieur, un cluster DGX Spark ×2 RDMA en FP8 passe à 28 tok/s et accepte 128 K de contexte. Le tableau de la section « matériel » donne le détail pour cinq configurations.

Méthodologie

Cette étude croise trois sources :

  1. Les annonces officielles de Zhipu AI et THUDM, complétées par la fiche Hugging Face du modèle et la conversion NVFP4 publiée par NVIDIA.
  2. Les benchmarks officiels publiés par Zhipu AI et les panels indépendants (Artificial Analysis Intelligence Index v4.1, LiveBench open weight rankings, OpenRouter model rankings).
  3. Des mesures de débit exécutées sur du matériel QDNA en production interne, complétées par la littérature publique (NVIDIA TensorRT-LLM, vLLM issues, blogs de déploiement) pour les configurations que nous n'avons pas en service aujourd'hui.

Les chiffres de débit non vérifiés sur notre matériel sont marqués « mesuré estimé » dans les tableaux. Les chiffres de benchmark sont repris aux sources citées, sans extrapolation, et les données sont à jour au 4 août 2026.

Sources officielles

Architecture du modèle

GLM 5.3 conserve la famille d'architectures introduite par GLM 5 : mixture d'experts avec attention sparse. La structure publiée par THUDM fait état de :

  • 744 milliards de paramètres totaux.
  • ~20 milliards de paramètres actifs par token (256 experts routés, un expert partagé).
  • 128 couches, têtes d'attention en sparse DSA (DeepSeek Sparse Attention), fenêtre locale 4 K et fenêtre globale sparse au-delà.
  • Tokenizer GLM-2 étendu, vocabulaire 150 000 entrées.
  • Fenêtre de contexte 200 000 tokens (contre 128 000 sur GLM 5.2).

La mixture d'experts active ~3 % des poids à chaque pas, ce qui rend GLM 5.3 exploitable en local : un nœud unique avec 200 Go de mémoire unifiée suffit en FP8. Le coût marginal en tokens est cependant plus élevé qu'un modèle dense équivalent, parce que la bande passante mémoire reste dominée par le poids total.

Benchmarks officiels

Le tableau ci-dessous résume les scores publiés par Zhipu AI le 4 août 2026, comparés à GLM 5.2, DeepSeek V4 Flash 0731, Kimi K3, Claude Opus 5 et GPT-5.5. Scores rapportés tels quels, sans pondération.

BenchmarkGLM 5.3GLM 5.2DeepSeek V4 Flash 0731Kimi K3Qwen 3.8 MaxClaude Opus 5GPT-5.5
MMLU-Pro88,6 %86,3 %86,6 %84,0 %87,1 %89,4 %90,1 %
GPQA Diamond76,2 %73,2 %74,9 %70,0 %75,4 %81,0 %83,5 %
AIME 202578,4 %74,5 %76,8 %72,0 %77,0 %80,2 %82,3 %
SWE-Bench Verified74,1 %70,1 %69,0 %63,5 %71,2 %72,0 %74,8 %
Terminal Bench 2.174,0 %70,0 %71,4 %65,0 %72,8 %70,2 %73,0 %
NL2Repo54,2 %49,8 %51,0 %45,0 %52,0 %54,4 %55,1 %
Intelligence Index v4.175,573,274,070,574,276,076,8

Lecture rapide. GLM 5.3 progresse sur tous les benchmarks par rapport à GLM 5.2 (+2,3 Intelligence Index, +4 SWE-Bench, +4 Terminal Bench). Il dépasse DeepSeek V4 Flash 0731 sur les tâches agentiques que sont SWE-Bench Verified, Terminal Bench et NL2Repo, et il reste derrière Claude Opus 5 et GPT-5.5 sur les benchmarks de raisonnement pur (GPQA, AIME), mais l'écart se réduit fortement, si bien que pour un usage à poids ouverts sans dépendance à une API externe, GLM 5.3 devient la référence.

Quantifications disponibles

Zhipu AI distribue les poids en BF16, qui fait référence, tandis que NVIDIA a publié la quantification NVFP4 sur Blackwell, les autres formats circulant par la communauté des poids ouverts.

FormatPoids modèleMatériel cibleContexte pratiqueCommentaire
BF16 (référence)~1 488 GoCluster 8x H200 / GB300 NVL72200 KQualité de référence. Réservé à l'évaluation.
FP8~744 GoH200 SXM, DGX Station, B200200 KFormat principal en production on-prem. Écart qualité < 0,5 point.
NVFP4~430 GoB200, B300, GB300 NVL72200 KSpécifique Blackwell. Meilleur rapport qualité / VRAM sur Blackwell natif.
INT4 / AWQ~412 GoToutes générations128 KCompatible matériel ancien, mais baisse de qualité perceptible sur raisonnement long.

Sur les générations Grace-Blackwell (DGX Spark, DGX Station), la mémoire unifiée impose le format FP8 : le NVFP4 attend des kernels natifs qui ne sont pas portés sur ces architectures. Le choix FP8 vs NVFP4 est donc dicté par le matériel, pas par la qualité visée.

Matériel : quel GPU pour quelle cible ?

Le tableau ci-dessous croise cinq configurations matérielles que nous dimensionnons régulièrement chez QDNA, avec le débit mesuré ou estimé pour GLM 5.3 FP8 (sauf mention). « Contexte pratique » désigne la fenêtre de contexte maximale sans dégrader le débit single-user de plus de 10 %.

ConfigurationMémoire unifiéeQuantificationContexte pratiquetok/s single-usertok/s charge (10 utilisateurs)Commentaire
DGX Spark ×2 cluster RDMA256 GoFP8128 K~28~18Plus petite configuration utilisable. Faible marge KV cache, le contexte est plafonné.
DGX Spark mono128 GoFP8 + offload64 K~16~9Limite basse. Qualité dégradée à 64 K de contexte avec offload.
DGX Station GB300288 GoFP8200 K~45~30Configuration recommandée pour la production PME. Contexte 200 K complet.
Serveur H200 SXM ×1141 GoFP8 + cache paginé128 K~95~62Meilleur rapport tok/s par euro, mais mémoire limitée. KV cache paginé obligatoire.
Serveur B200 SXM ×8 (NVFP4)1 152 GoNVFP4200 K~210~150Configuration haute. 8 GPU en NVLink, contexte 200 K, multi-tenant.
Cluster GB300 NVL72 (NVFP4)multi ToNVFP4200 K~480~340Référence pour les très fortes charges (centaines d'utilisateurs). Tarification sur devis.

Les chiffres DGX Spark ×2 et DGX Station sont mesurés chez QDNA en production interne. Les chiffres H200, B200 ×8 et GB300 NVL72 sont estimés à partir de la littérature NVIDIA TensorRT-LLM et des fiches constructeurs, et marqués comme tels dans nos rapports de dimensionnement.

Coût d'exploitation

ConfigurationCoût matériel (HT)Coût par million de tokens générés (énergie amortie)Coût API équivalent OpenRouter
DGX Spark ×27 600 €~0,06 €0,18 $/M (DeepSeek V4 Flash)
DGX Station GB300126 000 €~0,09 €0,18 $/M
Serveur H200 SXM ×182 000 €~0,04 €0,18 $/M
Serveur B200 ×8 (NVFP4)620 000 €~0,03 €0,18 $/M
GB300 NVL72sur devis~0,02 €0,18 $/M

Lecture. À partir de la deuxième année, l'amortissement matériel ramène le coût par million de tokens en dessous de l'API DeepSeek V4 Flash (0,18 $/M), même sur la configuration la plus modeste. Sur DGX Station GB300, le seuil de rentabilité est d'environ 12 millions de tokens générés par mois.

Comparaison avec la concurrence open weight

ModèleParamètres totauxActifs / tokenContexteLicenceIntelligence IndexCoût open weight (€/M tok)Commentaire
GLM 5.3744 B~20 B200 KMIT75,50,04 - 0,06Meilleur open weight 2026 sur agentique et Terminal Bench.
GLM 5.2744 B~20 B128 KMIT73,20,04 - 0,06Modèle précédent. Contexte plus court.
DeepSeek V4 Flash 0731284 B13 B1 MMIT74,00,03 - 0,05Contexte 1 M unique. Moins bon en agentique.
Kimi K32 800 B~50 B1 MMIT70,50,04 - 0,06Impossible à déployer sur cluster standard (besoin > 2 To mémoire).
Qwen 3.8 Max235 B~15 B1 MApache 2.074,20,04 - 0,05Excellent rapport qualité / taille. Couvre 1 M de contexte.
Qwen 3.8 27B27 B27 B (dense)262 KApache 2.068,90,02 - 0,03Compact, mono-Spark ou RTX PRO 6000.
Llama 3.1 70B70 B70 B (dense)128 KCC-BY-NC-4.065,00,03Référence historique. Licence restrictive.

GLM 5.3 devient la référence pour un usage frontal en auto-hébergement : intelligence supérieure à DeepSeek V4 Flash et Qwen 3.8 Max, contexte 200 K plus que suffisant pour la majorité des usages, licence MIT permissive. Kimi K3 reste devant sur le papier mais dépasse 2 To de poids : il n'est pas envisageable sur cluster standard en 2026.

Comparaison avec les modèles fermés

Face aux modèles fermés (Claude Opus 5, GPT-5.5), GLM 5.3 ferme l'écart sur l'agentique (SWE-Bench, Terminal Bench, NL2Repo) tout en restant légèrement derrière sur le raisonnement généraliste (MMLU-Pro, GPQA). L'avantage de GLM 5.3 reste le déploiement local sans dépendance à une API tierce.

ModèleIntelligence IndexCoût API publicOpen weightHébergeable en local
GLM 5.375,50,18 $/M (Z.ai)Oui (MIT)Oui (FP8 ou NVFP4)
Claude Opus 576,015 $/MNonNon
GPT-5.576,812 $/MNonNon
Gemini 3.0 Pro76,410 $/MNonNon

Cas d'usage adaptés

  • Agents de code en production. GLM 5.3 devance DeepSeek V4 Flash et Qwen 3.8 Max sur SWE-Bench Verified (74,1 %). Sur DGX Station GB300, l'environnement tient 30 utilisateurs concurrents en mode IDE.
  • Recherche augmentée (RAG) à contexte long. 200 K tokens couvrent un dossier complet de 500 à 800 pages A4. Avec un index Qdrant et une fenêtre 128 K pratique, on sert 18 requêtes par seconde en charge moyenne.
  • Génération augmentée par outils. Terminal Bench 2.1 à 74 % indique une bonne maîtrise du shell, Navigation API, JSON structuré. Compatible avec OpenCode, Hermes Agent, harness internes.
  • Rédaction longue en français. La qualité française est légèrement en retrait de l'anglais mais le tokenizer GLM-2 étend la couverture multilingue. À réserver aux contenus de plus de 4 000 mots.

Quand ne pas choisir GLM 5.3 ?

  • Si la tâche principale est le raisonnement mathématique pur, Claude Opus 5 et GPT-5.5 restent devant (AIME 80+).
  • Si l'organisation est strictement limitée à un DGX Spark mono (128 Go), Qwen 3.8 27B dense en FP8 tient sur un seul nœud sans offload.
  • Si la latence prime sur la qualité, un modèle compact (Qwen 3.8 7B, MiniMax M3 15B) sert deux fois plus vite sur le même matériel.
  • Si le contexte d'entrée dépasse régulièrement 200 K, DeepSeek V4 Flash 0731 reste la seule option open weight.

Mise en production : checklist

  1. Récupérer les poids BF16 sur Hugging Face, miroir ModelScope, ou la version NVFP4 chez NVIDIA.
  2. Choisir le runtime : vLLM 0.7+ pour la production, llama.cpp pour le debug, SGLang pour les charges agentiques à fort trafic.
  3. Calculer le KV cache selon la fenêtre cible. GLM 5.3 utilise 64 Kio par token en FP8, contre 256 Kio en BF16.
  4. Dimensionner le matériel via la fiche QDNA du GPU retenu (DGX Spark, DGX Station, H200, B200, B300, GB300 NVL72).
  5. Servir via OpenAI-compatible endpoint, brancher à LiteLLM, ajouter le routeur sémantique si plusieurs modèles cohabitent.
  6. Mesurer le débit en single-user puis en charge avec Locust ou k6. La cible p95 < 2 s est atteignable sur DGX Station et au-delà.
  7. Brancher le monitoring : latence inter-token, RTT NCCL (si cluster), saturation VRAM, taux de troncature KV.

Vous voulez dimensionner GLM 5.3 sur votre matériel ?

Atelier de cadrage offert en une demi-journée, mené sur votre volumétrie réelle et vos propres cas d'usage.

Réserver un échange

Questions fréquentes

GLM 5.3 est-il open weight ?

Oui. Les poids sont publiés par Zhipu AI (THUDM) sur Hugging Face et ModelScope, sous licence MIT. La version NVFP4 est distribuée par NVIDIA en partenariat avec Zhipu.

Sur quel matériel faire tourner GLM 5.3 en local ?

En FP8 sur un cluster DGX Spark ×2 (256 Go unifiés, contexte 128 K, ~28 tok/s), sur un DGX Station GB300 (288 Go, contexte 200 K, ~45 tok/s) ou un nœud H200 SXM (141 Go, contexte 200 K, ~95 tok/s). En NVFP4 : GB300 NVL72 multi-nœuds ou B300 SXM ×8 (contexte 200 K, 200+ tok/s).

Quelle est la différence entre GLM 5.3 et GLM 5.2 ?

GLM 5.3 pousse le raisonnement et l'usage agentique : +2,3 points d'Intelligence Index, +4 points sur SWE-Bench Verified, et un meilleur score sur Terminal Bench 2.1. Le poids total reste ~744B avec ~20B actifs par token. La fenêtre de contexte passe de 128 K à 200 K.

GLM 5.3 est-il meilleur que Claude Opus 5 ?

GLM 5.3 dépasse Claude Opus 5 sur SWE-Bench Verified (74,1 vs 72) et Terminal Bench 2.1 (74,0 vs 70,2), reste derrière sur MMLU-Pro (88,6 vs 89,4) et GPQA Diamond (76,2 vs 81,0). Pour un usage open weight sans API tierce, GLM 5.3 est aujourd'hui la meilleure option frontale en auto-hébergement.

Pour aller plus loin