QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

GLM-5.3-Flash sur Mac Studio M5 Ultra : 320 milliards de paramètres dans 512 Go

Un modèle de 320 milliards de paramètres tient sur une machine de bureau, en 8 bits et sans compromis de quantification, parce que trente-quatre de ses quarante-cinq couches n'accumulent aucun cache. Voici le dimensionnement, le contexte réellement servi et le débit calculé.

Mac Studio M5 Ultra
Réponse courte. La conversion MLX 8 bits pèse 334,1 Go mesurés et tient donc dans les 512 Go du M5 Ultra, la version 4 bits descendant à 177,5 Go. Le cache clé-valeur ne coûte que 11 Kio par token grâce à l'attention latente, si bien que la fenêtre native d'un million de tokens ne demande que 11,8 Go. Le plafond de génération se situe autour de 64 tokens par seconde en 8 bits, et 120 en 4 bits.

Une architecture faite pour le contexte long

La fiche publiée par Z.ai annonce 320 milliards de paramètres au total pour 18 milliards actifs par token, sous licence MIT, ce qui reste rare à cette échelle et autorise l'usage commercial comme la redistribution. Le config.json précise le reste : quarante-cinq couches, dont trente-quatre en attention linéaire et onze en attention creuse de type MLA, avec un routage vers huit experts sur deux cent quatre-vingt-huit plus un expert partagé.

Le point décisif pour le dimensionnement tient dans la valeur kv_lora_rank, fixée à 512. L'attention latente ne stocke pas des clés et des valeurs séparées mais un unique vecteur compressé par couche et par token, ce qui réduit le cache d'un ordre de grandeur par rapport à une attention classique. La fenêtre déclarée dans la configuration atteint 1 048 576 tokens.

Ce qu'il pèse en MLX

Comme pour les autres modèles de cette taille, aucune conversion ne provient de l'organisation mlx-community, et les versions disponibles sont publiées par des contributeurs individuels. Les tailles ci-dessous sont relevées sur les fichiers publiés.

ConversionPoids sur disqueReste sur 512 Go
MLX 8 bits334,1 Go178 Go
MLX 4 bits177,5 Go334 Go

La version 8 bits reproduit fidèlement le format FP8 natif des poids d'origine, ce qui en fait la référence de qualité, et elle laisse encore 178 Go pour le cache et le système. La version 4 bits divise l'empreinte par deux et double le débit théorique, au prix d'une dégradation qu'il faut mesurer sur vos propres tâches plutôt que supposer.

Combien de contexte tient réellement

Onze couches seulement portent un cache, et chacune ne stocke qu'un latent de 512 valeurs par token, ce qui donne 11 Kio par token en FP16 et 5,5 Kio en FP8. Rapporté à la fenêtre déclarée, le résultat surprend.

ContexteCache FP16Cache FP8
262 144 tokens3,0 Go1,5 Go
1 048 576 tokens (fenêtre déclarée)11,8 Go5,9 Go

Même en 8 bits, où les poids consomment déjà 334 Go, les 178 Go restants couvriraient près de seize millions de tokens de cache en FP16. La fenêtre du modèle est donc atteinte très avant la limite de la machine, ce qui renverse l'intuition héritée des architectures à attention complète, où le contexte long se payait en dizaines de gigaoctets.

Le débit qu'on peut attendre

Le calcul suit la même règle que pour tout modèle à mélange d'experts, puisque seuls les paramètres actifs sont relus à chaque token. Les tailles mesurées donnent 1,044 octet par paramètre en 8 bits et 0,555 en 4 bits, ce qui conduit aux deux plafonds ci-dessous.

ConversionLecture par tokenPlafond arithmétique
MLX 8 bits18,8 Go~64 tokens/s
MLX 4 bits10,0 Go~120 tokens/s

Ces valeurs divisent la bande passante de 1,2 To/s du M5 Ultra par le volume relu, et il s'agit donc de calculs et non de relevés. Le débit observé se situe généralement entre soixante et quatre-vingts pour cent d'un tel plafond, et l'écart entre les deux quantifications montre surtout que le choix se joue entre la qualité des sorties et la vitesse, pas entre tenir et ne pas tenir.

Face à Qwen3.8-Flash-Next

Les deux modèles visent la même machine et adoptent la même idée d'architecture hybride, mais ils n'arbitrent pas de la même façon. Qwen active six milliards de paramètres et plafonne autour de 320 tokens par seconde, quand GLM en active dix-huit et plafonne à 120 en 4 bits, l'écart de vitesse se payant en capacité de raisonnement. Notre article dédié détaille le premier cas, sur Qwen3.8-Flash-Next servi en MLX.

Les réserves

La configuration à 512 Go du Mac Studio M5 Ultra est annoncée pour la fin octobre 2026, ce qui rend toute mesure impossible aujourd'hui et explique que cet article s'en tienne aux calculs. La fiche officielle du modèle reste par ailleurs avare en détails, puisqu'elle ne publie ni le nombre de couches, ni la taille des fichiers, ni la fenêtre de contexte, toutes valeurs que nous avons lues dans la configuration du dépôt.

Questions fréquentes

GLM-5.3-Flash tient-il sur un Mac Studio M5 Ultra ?

Oui, dans la configuration 512 Go. La conversion MLX 8 bits pèse 334,1 Go mesurés et laisse 178 Go pour le cache et le système, tandis que la version 4 bits descend à 177,5 Go. Aucune des deux ne tient sur la machine d'entrée à 96 Go.

Quelle longueur de contexte peut-on servir ?

La configuration déclare une fenêtre de 1 048 576 tokens, et le cache correspondant ne coûte que 11,8 Go en FP16, parce que onze couches sur quarante-cinq seulement portent un cache et qu'elles n'y stockent qu'un latent compressé de 512 valeurs. La mémoire de la machine n'est donc jamais le facteur limitant.

Faut-il préférer la conversion 4 bits ou 8 bits ?

La version 8 bits reproduit le format FP8 natif des poids d'origine et sert de référence de qualité, au plafond de 64 tokens par seconde. La version 4 bits double le débit théorique et libère 156 Go de mémoire, mais la perte de qualité doit se mesurer sur vos propres tâches avant tout engagement.

Sous quelle licence le modèle est-il publié ?

Les poids sont sous licence MIT, ce qui autorise l'ajustement fin, le déploiement commercial et la redistribution. C'est une licence nettement plus permissive que celles retenues par plusieurs modèles concurrents de taille comparable.

Références

Dimensionner votre machine

Un échange pour confronter ce calcul à votre charge réelle, votre longueur de contexte et votre nombre d'utilisateurs.

Réserver un échange