QDNAPlateformes IA souveraines

Mac Studio M5 Ultra : 512 Go à 1,2 To/s, ce que ça change pour un LLM local

Apple a annoncé le Mac Studio M5 Ultra le 25 août 2026. La machine passe à 1,2 To/s de bande passante mémoire unifiée, garde un plafond de 512 Go et démarre à 6 599 € TTC en France. Voici ce que ces chiffres permettent réellement, et ce que personne ne peut encore affirmer, faute de mesure.

Mac Studio M5 Ultra : 512 Go de mémoire unifiée et 1,2 To/s de bande passante
Réponse courte. Le M5 Ultra apporte +47 % de bande passante mémoire par rapport au M3 Ultra (1,2 To/s contre environ 819 Go/s), à capacité mémoire inchangée (512 Go maximum). Comme la génération de tokens est bornée par la bande passante et non par le calcul, c'est un gain direct et proportionnel sur le débit de sortie. La capacité, elle, ne bouge pas : les modèles qui ne tenaient pas hier ne tiennent toujours pas. Et à ce jour, aucune mesure indépendante n'existe : la machine n'est livrée qu'à partir du 22 septembre 2026.

Ce qu'Apple a annoncé, chiffres officiels

Apple décline deux puces aux positionnements distincts : le M5 Max s'adresse au poste de travail créatif, tandis que le M5 Ultra intéresse une plateforme d'inférence, puisqu'il demeure le seul à dépasser 128 Go de mémoire unifiée.

M5 MaxM5 Ultra
CPU (base)18 cœurs (6 super + 12 performance)30 cœurs (10 super + 20 performance)
CPU (configurable)18 cœurs36 cœurs
GPU32 cœurs, ou 40 en option64 cœurs, ou 80 en option
Neural Engine16 cœurs32 cœurs
Bande passante mémoire460 Go/s, ou 614 Go/s avec le GPU 40 cœurs1,2 To/s sur les deux variantes
Mémoire unifiée36 Go, configurable 48 / 64 / 128 Go96 Go, configurable 256 ou 512 Go
Stockage512 Go, jusqu'à 8 To1 To, jusqu'à 16 To
Prix France (à partir de)2 999 € TTC6 599 € TTC
Consommation maximale continue480 W
Disponibilité22 septembre 2026 · option 512 Go fin octobre

Sources : caractéristiques techniques Apple France et communiqué Apple Newsroom du 25 août 2026. Prix relevés sur l'Apple Store France le 28 août 2026.

Deux détails de la grille de configuration comptent davantage que le reste, et l'un comme l'autre se laissent facilement manquer à la lecture d'une fiche produit.

Les options 256 et 512 Go ne sont pas disponibles sur la configuration d'entrée de gamme. Apple les réserve à la variante dotée du CPU 36 cœurs et du GPU 80 cœurs, si bien qu'une machine facturée 6 599 € ne peut donc pas être portée à 512 Go : il faut d'abord passer sur le châssis supérieur, facturé 8 029 € TTC en configuration de base, avant même de payer la mémoire.

La bande passante ne dépend pas de la quantité de mémoire commandée. Les 1,2 To/s sont en effet annoncés sur les deux variantes M5 Ultra, y compris celle à 96 Go. C'est l'inverse du M5 Max, dont la bande passante monte de 460 à 614 Go/s uniquement avec le GPU 40 cœurs. Pour un usage LLM, cela veut dire qu'une M5 Ultra 96 Go délivre le même débit de génération qu'une 512 Go : sur les modèles qui tiennent dans 96 Go.

1,2 To/s : le seul chiffre qui décide du débit de sortie

Servir un modèle de langage, ce sont deux régimes distincts, et ils ne dépendent pas du même composant. Nous l'avons détaillé dans prefill, decode et cache KV : quel matériel pour un LLM ; le M5 illustre cette séparation de façon presque caricaturale.

Apple l'écrit noir sur blanc dans sa propre publication de recherche : « générer le premier token est borné par le calcul », tandis que « générer les tokens suivants est borné par la bande passante mémoire, et non par la capacité de calcul ». Les Neural Accelerators intégrés au GPU M5 accélèrent donc massivement la phase de prefill, et beaucoup moins la génération.

Les mesures publiées par Apple, qui comparent un M5 à un M4, donnent l'ordre de grandeur de cette dissociation :

ModèleFormatPremier token (TTFT)GénérationMémoire
Qwen3-1.7BBF16× 3,57× 1,274,40 Go
Qwen3-8BBF16× 3,62× 1,2417,46 Go
Qwen3-8B4 bits× 3,97× 1,245,61 Go
Qwen3-14B4 bits× 4,06× 1,199,16 Go
Qwen3-30B-A3B4 bits× 3,52× 1,2517,31 Go
gpt-oss-20bMXFP4-Q4× 3,33× 1,2412,08 Go

Source : Apple Machine Learning Research, « Exploring LLMs with MLX and the Neural Accelerators in the M5 GPU ». Méthode : invite de 4 096 tokens, 128 tokens générés, MLX. Ces mesures comparent un M5 à un M4 sur MacBook Pro, pas un M5 Ultra à un M3 Ultra. Elles décrivent le comportement de l'architecture, pas la performance de la machine dont parle cet article.

Le rapport est spectaculaire dans une colonne et modeste dans l'autre : jusqu'à quatre fois plus vite sur le premier token, un cinquième à un quart de mieux sur la suite. Et l'écart s'explique entièrement par la bande passante : entre M4 et M5, elle passe de 120 à 153 Go/s, soit +28 %, très exactement l'ordre de grandeur du gain observé en génération.

C'est précisément ce qui rend le chiffre annoncé pour le M5 Ultra intéressant, puisque passer de 819 Go/s à 1,2 To/s représente +47 % sur la grandeur qui borne la génération. Sur une machine dont la capacité mémoire ne bouge pas, c'est là que se trouve tout le progrès.

Le plafond de génération, calculé et non mesuré

Personne n'a encore mesuré un M5 Ultra, puisque la machine n'est livrée qu'à partir du 22 septembre 2026 et que la configuration à 512 Go n'arrivera qu'en fin octobre. Les débits en tokens par seconde qui circulent déjà relèvent donc de l'estimation, parfois présentée comme un relevé, raison pour laquelle nous ne les reproduisons pas.

Le plafond, en revanche, se calcule sans ambiguïté à partir des seules caractéristiques publiées, puisque générer un token suppose de lire les poids qui participent effectivement au calcul, soit la totalité des paramètres pour un modèle dense, soit les seuls experts activés pour une architecture à mélange d'experts. Diviser la bande passante annoncée par ce volume fournit une borne supérieure que le matériel ne peut structurellement pas dépasser, et dont on atteint en pratique 50 à 80 % selon le runtime retenu, la longueur du contexte et la concurrence.

ModèlePoids lus par tokenFormatVolume luPlafond à 1,2 To/s
Qwen3.8-Flash-Next6 B actifs sur 125 BQ43 Go≈ 400 tokens/s
Qwen3.8-Flash-Next6 B actifs sur 125 BFP86 Go≈ 200 tokens/s
DeepSeek V4 Flash 073113 B actifs sur 284 BQ46,5 Go≈ 185 tokens/s
GLM 5.3 Flash18 B actifs sur 320 BQ49 Go≈ 133 tokens/s
GLM 5.3 Flash18 B actifs sur 320 BFP818 Go≈ 67 tokens/s
Qwen3.8-27B27 B (dense)Q413,5 Go≈ 89 tokens/s

Calcul QDNA : bande passante annoncée ÷ volume de poids lus par token. Ce sont des plafonds arithmétiques, pas des mesures. Ils n'incluent ni la lecture du cache d'attention, ni les activations, ni le surcoût du runtime. Le tableau ne retient que des modèles qui logent effectivement sur la machine et dont le nombre de paramètres actifs est publié : Qwen3.8-Flash-Next (125 B, 6 B actifs), DeepSeek V4 Flash 0731 (284 B, 13 B actifs), GLM 5.3 Flash (320 B, 18 B actifs) et Qwen3.8-27B (dense). Les très grands modèles à mélange d'experts comme Kimi K3 sont exclus : ils ne tiennent dans aucun format, donc aucun débit n'a de sens pour eux ici.

Sur la même arithmétique, un M3 Ultra à 819 Go/s plafonnerait à environ 273 tokens/s pour Qwen3.8-Flash-Next en Q4, contre 400 pour le M5 Ultra ; 126 contre 185 pour DeepSeek V4 Flash 0731. Le rapport de 1,47 se retrouve ligne par ligne, puisqu'il ne dépend que de la bande passante.

Quels modèles logent, selon la mémoire commandée

La capacité, en revanche, n'a pas bougé depuis le M3 Ultra et 512 Go demeure le plafond, si bien que la question « quel modèle tient » a donc la même réponse qu'avant, et elle dépend entièrement de l'option mémoire choisie.

ModèleTotal / actifs96 Go256 Go512 Go
Qwen3.8-27B27 B, denseFP16FP16FP16
Qwen3.8-Flash-Next125 B / 6 BQ4 (72 Go)FP8 (144 Go)FP16 (288 Go)
DeepSeek V4 Flash 0731284 B / 13 Bne tient pasQ4 (163 Go)FP8 (327 Go)
GLM 5.3 Flash320 B / 18 Bne tient pasQ4 (184 Go)FP8 (368 Go)

Calcul QDNA : paramètres × octets par paramètre × 1,15 de marge d'exécution, hors cache d'attention. Même règle que la matrice de dimensionnement. Tailles et paramètres actifs relevés sur les fiches officielles : Qwen3.8-Flash-Next (125 B, 6 B actifs, 262 144 tokens natifs extensibles à 1 M), DeepSeek V4 Flash 0731 (284 B, 13 B actifs) et GLM 5.3 Flash (320 B, 18 B actifs, licence MIT). Consultées le 28 août 2026.

Le verdict s'est inversé avec la génération actuelle de modèles ouverts, pour une raison qui tient à leur architecture : les conceptions à mélange d'experts « Flash » activent peu de paramètres par token, ce qui les rend à la fois compactes une fois quantifiées et rapides : la configuration d'entrée à 96 Go fait déjà tourner Qwen3.8-Flash-Next en Q4, et pas seulement un modèle dense de 27 B. Ce sont les 256 et 512 Go qui ouvrent DeepSeek V4 Flash et GLM 5.3 Flash, et eux seuls justifient de passer sur la variante 36 cœurs.

Ce qui reste hors de portée, ce sont les modèles à très grand nombre total de paramètres, quel que soit le nombre d'actifs : Kimi K3 (2 800 B) demande environ 1 610 Go de poids en Q4. C'est la limite structurelle de la machine : 512 Go, c'est beaucoup pour un poste de travail, et peu face à un DGX Station ou à un serveur RTX PRO 6000.

MLX : ce que 512 Go achètent réellement

Sur Apple Silicon, le choix du runtime d'inférence conditionne directement les performances observées. L'étude comparative de Rajesh et al., menée sur un Mac Studio M2 Ultra à 192 Go avec la famille Qwen-2.5 et des invites de quelques centaines à 100 000 tokens, conclut que MLX obtient le débit de génération soutenu le plus élevé, tandis que MLC-LLM donne un temps au premier token plus bas sur les invites moyennes, et que llama.cpp reste très efficace en usage mono-flux léger. Les auteurs posent aussi la limite honnêtement : ces piles « restent en retrait des systèmes GPU NVIDIA comme vLLM en performance absolue ».

Cette hiérarchie recoupe les mesures publiées par Apple : les Neural Accelerators accélèrent la phase de prefill tandis que la génération demeure bornée par la bande passante mémoire, et MLX reste le runtime qui exploite conjointement ces deux dimensions.

L'échelle de quantification, mesurée

C'est ici que la capacité mémoire cesse d'être une ligne de fiche technique pour devenir une décision de qualité. Les conversions MLX de GLM 5.3 Flash publiées par orcarouter sont accompagnées de mesures de perplexité et d'accord de token, contre la référence FP8 :

Variante MLXTaille sur disquePerplexité vs FP8Accord du 1er tokenMachine minimale
6 bits≈ 296 Go+ 0,24 %97,76 %512 Go
4 bits≈ 204 Go+ 2,96 %96,13 %256 Go
3 bits≈ 184 Go+ 9,96 %92,06 %256 Go
2 bits≈ 145 Go+ 56,9 %86,56 %256 Go
2 bits « lite »≈ 102 Go+ 141 %77,19 %128 Go

Source : orcarouter/GLM-5.3-Flash-MLX, perplexité mesurée contre la référence FP8 à 2,7797. La colonne « machine minimale » est notre lecture : taille sur disque plus une marge pour le cache d'attention et l'état d'exécution.

La lecture de ce tableau est aussi abrupte qu'instructive pour qui doit arbitrer une commande, car entre 6 et 4 bits, la qualité ne perd qu'un peu moins de trois points de perplexité et l'accord de token se maintient au-dessus de 96 %, ce qui rend l'écart réel mais discutable. Entre 4 et 2 bits en revanche, la perplexité augmente de 57 % et l'accord chute à 86,6 %. L'auteur de ces conversions le dit sans détour pour la variante la plus agressive : « la génération de code longue n'est pas fiable à cette précision », avec des boucles de répétition et du code manquant.

Autrement dit : 512 Go n'achètent pas la capacité de faire tourner un modèle de plus, ils achètent le droit de le faire tourner en 6 bits plutôt qu'en 4. Sur un usage de rédaction ou de questions-réponses, l'écart entre ces deux précisions ne se verra pas à l'usage. Sur de la génération de code longue, c'est exactement là que se situe la frontière entre un assistant utilisable et un assistant qui invente.

GLM 5.3 Flash sur M5 Ultra, le cas concret

Croiser les trois données précédentes donne le tableau qu'un acheteur cherche réellement, puisque la variante MLX retenue détermine à la fois la machine nécessaire, le débit atteignable et la qualité conservée. GLM 5.3 Flash active 18 milliards de paramètres sur 320, ce qui fait de son plafond de génération une fonction directe de la précision choisie : moins de bits par paramètre signifie moins d'octets relus à chaque token, donc davantage de tokens par seconde, au prix d'une dégradation que les mesures de perplexité chiffrent précisément.

Variante MLXTailleMachine minimalePlafond à 1,2 To/sPerplexitéAccord du 1er token
6 bits≈ 296 Go512 Go≈ 89 tokens/s+ 0,24 %97,76 %
4 bits≈ 204 Go256 Go≈ 133 tokens/s+ 2,96 %96,13 %
3 bits≈ 184 Go256 Go≈ 178 tokens/s+ 9,96 %92,06 %
2 bits≈ 145 Go256 Go≈ 267 tokens/s+ 56,9 %86,56 %

Tailles, perplexité et accord de token relevés sur orcarouter/GLM-5.3-Flash-MLX. Les plafonds sont un calcul QDNA, bande passante annoncée divisée par les 18 milliards de paramètres actifs à la précision considérée, et non une mesure. La colonne « machine minimale » ajoute à la taille du modèle une marge pour le cache d'attention et l'état d'exécution.

La lecture pratique tient en une phrase : la configuration à 512 Go est la seule qui permette de servir GLM 5.3 Flash en 6 bits, c'est-à-dire à une qualité pratiquement indistinguable de la référence FP8, tandis que 256 Go imposent de descendre en 4 bits et d'accepter trois points de perplexité supplémentaires. Le mouvement est contre-intuitif pour qui raisonne en débit, puisque descendre en précision accélère la génération : 4 bits plafonne à 133 tokens par seconde contre 89 en 6 bits. Autrement dit, les 512 Go n'achètent pas de la vitesse, ils achètent le droit de renoncer à en gagner au détriment de la qualité.

Reste la contrainte pratique, que la fiche produit ne mentionne pas : au moment de la livraison de la machine, servir ce modèle suppose d'installer mlx-vlm depuis sa branche principale, où l'architecture glm5_next n'est arrivée que le 26 août 2026, avec le correctif tiers qui rétablit la parité numérique avec la référence.

L'état réel du support

Un point que les fiches produit ne mentionnent pas et qui décide de la faisabilité à court terme : l'architecture glm5_next n'est arrivée dans la branche principale de mlx-vlm que le 26 août 2026, et aucune version publiée ne la porte encore. La conversion 4 bits de PipeNetwork, qui pèse 177,6 Go contre 642,7 Go pour le bfloat16 amont, documente au passage deux bugs numériques et deux écarts d'epsilon trouvés dans cette branche, corrigés par un runtime rustiné qui atteint une parité de 1e-6 de bout en bout avec la référence.

Cette situation ne relève pas du détail d'implémentation, car elle signifie qu'au moment où la machine est livrée, exécuter le modèle qui l'intéresse le plus suppose d'installer mlx-vlm depuis la branche principale accompagnée d'un correctif tiers. L'opération demeure réalisable, mais elle ne correspond pas à ce que décrit une fiche commerciale.

Le cluster de quatre machines

Apple annonce qu'« un cluster de quatre Mac Studio permet d'obtenir des performances d'inférence d'IA jusqu'à 3 fois plus rapides », en s'appuyant sur Thunderbolt 5 et RDMA. La M5 Ultra dispose pour cela de six ports Thunderbolt 5 à 120 Gb/s, dont deux accessibles en façade du boîtier.

Cette annonce mérite d'être lue pour ce qu'elle énonce exactement, sans y projeter davantage : quatre machines pour un facteur trois représentent un rendement de 75 %, ce qui reste honnête pour du parallélisme de pipeline sur un lien externe, mais les 120 Gb/s annoncés correspondent à 15 Go/s, soit environ 1,2 % de la bande passante mémoire interne. Le lien entre machines est donc trois ordres de grandeur plus lent que la mémoire locale : le découpage doit être fait par couches, avec très peu d'échanges, et le gain porte sur le débit agrégé, pas sur la latence d'une requête isolée.

À titre de comparaison, l'UltraFusion qui relie les quatre puces à l'intérieur d'un même M5 Ultra dépasse 4,4 To/s. L'écart entre l'intérieur et l'extérieur du boîtier est ce qui rend le cluster utile pour servir plusieurs requêtes en parallèle, et peu utile pour accélérer une seule.

Face aux alternatives

Le Mac Studio n'a jamais gagné sur le débit brut, et le M5 Ultra ne change pas cela. Son terrain reste la mémoire par euro et par watt, dans un boîtier silencieux de 3,6 kg qui consomme 480 W au maximum.

Pour un poste d'inférence dédié à une équipe, installé dans un bureau plutôt que dans une salle serveur, la M5 Ultra représente aujourd'hui l'option la plus dense en mémoire qui ne réclame aucune infrastructure dédiée. Ce périmètre demeure étroit, mais il correspond à un besoin réel.

Ce qu'on ne sait pas encore

Trois inconnues restent ouvertes à la date de publication, et il vaut mieux les nommer explicitement que les combler par des estimations invérifiables.

Nous complèterons cet article par des relevés dès qu'une machine sera mesurable, selon la même méthode que la section mesures : un couple (modèle, format, matériel) par page, avec la procédure reproductible, et aucune valeur pour ce qui n'a pas été mesuré.

Ce qu'il faut retenir

Le M5 Ultra constitue une mise à jour de bande passante et non de capacité, ce qui détermine à qui il s'adresse. Les 47 % supplémentaires alimentent directement le débit de génération, qui en dépend linéairement, tandis que la question de savoir quel modèle tient en mémoire reçoit exactement la même réponse qu'avec un M3 Ultra. Une organisation dont la contrainte était la capacité ne verra donc aucune amélioration, alors qu'une organisation limitée par la vitesse à capacité constante bénéficiera de la progression la plus nette qu'Apple ait proposée sur cette gamme.

Le piège commercial réside dans la configuration d'entrée, puisqu'à 6 599 € la machine ne dispose que de 96 Go et ne peut pas être portée ultérieurement à 512 Go. Le dimensionnement se décide donc avant la commande et non après la livraison. Nous aidons à poser ce dimensionnement sur la matrice modèle × matériel, ou lors d'un échange de vive voix.

Questions fréquentes

Quelle est la bande passante mémoire du Mac Studio M5 Ultra ?

1,2 To/s de bande passante mémoire unifiée, sur les deux variantes de la puce M5 Ultra. Apple annonce 50 % de plus qu'auparavant, la génération M3 Ultra plafonnant à environ 819 Go/s. Pour la génération de tokens, qui est bornée par la bande passante et non par le calcul, c'est le chiffre qui décide de la vitesse.

Combien de mémoire peut-on mettre dans un Mac Studio M5 Ultra ?

96 Go en base, 256 ou 512 Go en option, mais uniquement sur la variante CPU 36 cœurs / GPU 80 cœurs, pas sur la configuration d'entrée. L'option 512 Go n'est annoncée que pour fin octobre 2026.

Quels modèles ouverts tiennent sur un Mac Studio M5 Ultra 512 Go ?

Quatre modèles ouverts de génération courante couvrent l'essentiel des usages sur cette machine. En 512 Go : GLM 5.3 Flash (320 B, 18 B actifs) et DeepSeek V4 Flash 0731 (284 B, 13 B actifs) en FP8, Qwen3.8-Flash-Next (125 B, 6 B actifs) jusqu'en FP16, et Qwen3.8-27B dense dans tous les formats. En 96 Go, deux d'entre eux tiennent : Qwen3.8-27B et Qwen3.8-Flash-Next en Q4. Les très grands modèles à mélange d'experts comme Kimi K3 (2 800 B) ne tiennent dans aucun format.

Le Mac Studio M5 Ultra remplace-t-il un serveur GPU NVIDIA ?

Pour un poste d'inférence à débit modéré et silencieux, il est crédible. Pour du service en production à forte concurrence, un serveur GPU garde l'avantage sur le débit agrégé et l'écosystème CUDA. L'affinage de modèles suppose encore du matériel NVIDIA.

Existe-t-il des mesures indépendantes de débit sur M5 Ultra ?

Non, aucune à la date de cet article. La machine n'est livrée qu'à partir du 22 septembre 2026 et la configuration 512 Go fin octobre. Les tokens par seconde qui circulent sont des estimations calculées, pas des relevés.