ASRock AI BOX-A395 + Qwen3.8-27B : 256K de contexte sur Strix Halo 128 GB

L'ASRock AI BOX-A395 (Ryzen AI Max+ 395, Radeon 8060S, 128 GB de LPDDR5X-8000 partagée) fait tourner Qwen3.8-27B multimodal en local, et voici les mesures de débit, le dimensionnement du cache KV, les fenêtres de contexte de 262k natives extensibles à 1 M, le comparatif des systèmes et les prix.

ASRock AI BOX-A395 : compact edge AI 128 GB pour Qwen3.8-27B multimodal

Le contexte

Le Strix Halo (Ryzen AI Max+ 395) est un cas particulier dans le paysage du local LLM : un APU avec un iGPU Radeon 8060S (RDNA 3.5, 40 CU) et jusqu'à 128 GB de LPDDR5X unifiée entre CPU, GPU et NPU. C'est la même mémoire qui sert de VRAM à l'iGPU via le mécanisme GTT (Graphics Translation Table).

ASRock Industrial a industrialisé cette puce dans l'AI BOX-A395, un boîtier compact d'IA de périphérie, que nous avons évalué sur Qwen3.8-27B, le multimodal vision-language publié par Alibaba/Qwen le 14 août 2026 sous licence Apache-2.0.

Spécifications de l'AI BOX-A395

ComposantDétail
APUAMD Ryzen AI Max+ 395 (Strix Halo), 16 cœurs / 32 threads, Zen 5 + Zen 5c, jusqu'à 5.1 GHz
iGPURadeon 8060S, RDNA 3.5, 40 CU, gfx1151
NPUXDNA 2, ~50 TOPS INT8
Mémoire128 GB LPDDR5X-8000 unifiée CPU/GPU/NPU (version 128 GB)
Stockage1 × M.2 2280 NVMe PCIe
Réseau10 GbE (selon configuration), WiFi 6E/7 optionnel
Ports USB2 × USB4, 1 × USB-C 3.2 Gen2, 2 × USB-A 3.2 Gen2, 2 × USB-A 2.0
AlimentationAC 100-240 V, 400 W (intégré)
OS supportésWindows 11, Linux (Ubuntu 24.04 LTS, Fedora 41+)

Sources : fiche ASRock Industrial, Electronics-Lab coverage.

Qwen3.8-27B : multimodal Apache-2.0

Qwen3.8-27B est publié le 14 août 2026 par Alibaba/Qwen, sous licence Apache-2.0. C'est un modèle multimodal vision-language (image + vidéo + texte), basé sur une architecture hybride Gated DeltaNet (linear attention) + Gated Attention.

ParamètreValeur (config.json)
Paramètres totaux27 B (dense)
Hidden dimension5120
Couches64
Têtes attention (Q)24
Têtes KV (GQA)4
Head dim attention256
Head dim linear (DeltaNet)128 (V:48 têtes, QK:16 têtes)
FFN intermediate17 408
Vocab size248 320
Context natif262 144 tokens (extensible à 1 000 000 via MTP)
Layout16 × (3 × (DeltaNet → FFN) → 1 × (Attention → FFN))
Multi-Token Prediction (MTP)Oui, entraîné multi-étapes

Source : huggingface.co/Qwen/Qwen3.8-27B : config.json verbatim.

Prérequis ROCm / Vulkan

Sur Strix Halo, deux approches coexistent pour llama.cpp :

  • Vulkan (recommandé en 2026) : support natif gfx1151, pas de HSA_OVERRIDE_GFX_VERSION, performances généralement supérieures à HIP/ROCm. Ollama-vulkan, LM Studio, llama.cpp Vulkan se partagent le même backend.
  • ROCm / HIP : nécessaire pour vLLM en batch serving. ROCm 7.13 officialise RDNA 3.5 APU. Toujours utiliser HSA_OVERRIDE_GFX_VERSION=11.5.1 sauf si ROCm 7.14+ détecte gfx1151 nativement.

Sur Fedora 41+ ou Ubuntu 24.04 LTS avec un noyau 6.13 ou plus récent, la commande rocminfo | grep gfx1151 doit retourner le périphérique. Sur Windows 11, vLLM n'est pas disponible, mais Vulkan fonctionne sans réglage préalable via LM Studio ou Ollama-vulkan.

Sources : ROCm 7.13 Expanding Hardware, llama.cpp Strix Halo build, NixOS Discourse.

Benchmarks mesurés

96k n'est pas le plafond de la machine, c'est le point où le profil de service publié a été mesuré. Le tableau du cache KV plus bas montre que le contexte natif de 262 144 tokens tient à 48 % de la mémoire (modèle Q8 30 GB + cache KV Q8 32 GB = 62 GB sur 128). Les débits ci-dessous valent donc pour 96k ; à 256K, attendez-vous à une baisse proportionnelle au volume de cache relu, sans que la mémoire devienne le facteur limitant.

Deux sources communautaires publient des benchmarks mesurés sur Qwen3.8-27B sur Strix Halo 128 GB :

SourceConfigurationThroughput
kyuz0 (r/LocalLLaMA, Q8/Q4 30k contexte, llama.cpp)Qwen3.8-27B Q8 / Q4_K_M~208.42 tokens/s (génération, 30k ctx)
KyaniteLabs (tuned serving profile, MTP n12 + ngram speculation)Qwen3.8-27B Q8, llama.cpp Vulkan59.7 tok/s cold, 148-158 tok/s warm @ 96k ctx

Le Q4 est plus rapide que le Q8 en tokens par seconde, mais le Q8 conserve une marge sur les bancs de qualité que sont MMLU, GPQA et le code. À 96k de contexte, la montée en régime prend une à deux minutes, le temps de charger le cache KV, après quoi le débit se stabilise.

Sources : kyuz0 r/LocalLLaMA benchmark, KyaniteLabs/qwen38-27b-strix-halo.

KV cache et fenêtres de contexte

Le KV cache de Qwen3.8-27B est dominé par les 4 têtes KV (GQA, 256 head_dim). Par token, en FP16 : 2 × 64 × 4 × 256 × 2 = 262 144 octets (~256 KiB/token).

ContexteFP16Q8Q4
32 768 (32k)~8.0 GiB~4.0 GiB~2.0 GiB
65 536 (64k)~16.0 GiB~8.0 GiB~4.0 GiB
131 072 (128k)~32.0 GiB~16.0 GiB~8.0 GiB
262 144 (262k natif)~64.0 GiB~32.0 GiB~16.0 GiB

Avec 128 GB partagés : modèle Q8 (30 GB) + KV Q8 (32 GB à 262k) = 62 GB sur 128, soit 48 % d'utilisation. Largement de quoi faire tourner en parallèle d'autres outils, ou de réserver la mémoire au KV cache pour des fenêtres plus longues.

Sources : config.json Qwen3.8-27B, kyuz0 amd-strix-halo-toolboxes.

Windows vs Linux

Pour Qwen3.8-27B multimodal, Vulkan est aujourd'hui le chemin de moindre friction, et la matrice suivante résume les options disponibles :

OSBackendvLLMUsage recommandé
Windows 11Vulkan (LM Studio, Ollama-vulkan, llama.cpp)Développement interactif, multimodal
Linux (Fedora 41+, Ubuntu 24.04 HWE)Vulkan ou ROCm✅ ROCmServing batch, multimodal, multimodal agentique

Pour une station de travail AI BOX-A395, Linux Fedora 41+ avec un noyau 6.14 ou plus récent est la cible privilégiée, avec vLLM, llama.cpp Vulkan, ROCm-SMI pour la supervision et l'accès BIOS à l'allocation de l'iGPU, tandis que Windows 11 reste valide pour un usage interactif via LM Studio, sans vLLM.

Source : KyaniteLabs/qwen38-27b-strix-halo.

Comparatif prix

L'AI BOX-A395 128 GB est listé à 3 999 $ HT chez MITXPC (intégrateur américain, tarif d'août 2026), soit environ 3 435 € HT au taux du 28 août 2026 (1 € = 1,164 $), avant la marge du canal de distribution européen (Avnet, Arrow, MITXPC EU). La NVIDIA DGX Spark se négocie aujourd'hui autour de 4 699 $ HT après la hausse liée à la mémoire, soit environ 4 037 € HT, ce qui place l'ASRock environ 15 % en dessous.

MachineRAM unifiéePrix indicatif 2026Usage
ASRock AI BOX-A395128 GB LPDDR5X partagée~3 435 € HT (3 999 $)Edge AI compact, multimodal local
Nvidia DGX Spark128 GB unifiée~4 037 € HT (4 699 $)CUDA, vLLM natif
Framework Desktop128 GB~1 900 € HT (frame seul)DIY modulaire
HP Z2 Mini G1a (Ryzen AI Max PRO)128 GB~2 500 € – 3 500 € HTWorkstation ECC
Minisforum MS-S1 MAX128 GB~1 500 € – 1 900 € HTMini-ITX alternative
Mac Studio M5 Ultra96 GB de base, jusqu'à 512 GBà partir de ~5 499 € HT (6 599 € TTC)1,2 To/s, plus rapide en MLX pur

Pour Qwen3.8-27B multimodal, l'AI BOX-A395 se place environ 15 % sous le DGX Spark au tarif courant, avec les avantages et les inconvénients inverses : le DGX Spark a CUDA et vLLM natif, quand l'AI BOX-A395 a ROCm en cours d'officialisation et Vulkan dès aujourd'hui. Le Mac Studio M5 Ultra, à partir de 6 599 € TTC soit environ 5 499 € HT, coûte sensiblement plus cher, mais il monte à 512 Go de mémoire unifiée servie à 1,2 To/s, pour une compatibilité vision moins bonne.

Sources : MITXPC (3 999,95 $ HT), HP Z2 Mini G1a, LinuxGizmos coverage.

Limites de cet article

Les chiffres t/s à 262k contexte (limite native de Qwen3.8-27B) et 1 M de tokens (extension MTP) restent à mesurer sur l'AI BOX-A395 spécifiquement. La communauté publie régulièrement sur r/StrixHalo et r/LocalLLaMA : à mesure que des benchmarks plus poussés arrivent (ETA Prime, Phoronix), nous mettons cet article à jour.

L'AI BOX-A395 est commercialisé par le canal industriel entre professionnels, si bien que le prix catalogue n'est pas public et qu'un devis reste nécessaire, les estimations de marché ci-dessus n'étant fournies qu'à titre indicatif.

Sources officielles

Questions fréquentes

L'ASRock AI BOX-A395 est-il le bon choix pour Qwen3.8-27B ?
Oui, à condition de choisir Vulkan ou ROCm pour llama.cpp, et Q8_0 ou Q4_K_M selon votre compromis qualité/vitesse. Le modèle multimodal s'installe comme un LLM texte classique : seul l'encodeur vision prend ~5 GB supplémentaires en mémoire.
Qwen3.8-27B ou Qwen3.5-27B-Instruct ?
Qwen3.8-27B pour le multimodal (image + vidéo + texte), Qwen3.5-27B-Instruct pour le texte pur. Le 3.8 est plus lent à cause de l'encodeur vision et des couches DeltaNet mixtes, mais ouvre les cas d'usage vision.
ROCm ou Vulkan pour llama.cpp ?
Vulkan. Plus stable, plus rapide, pas de override HSA_OVERRIDE_GFX_VERSION à gérer. ROCm est nécessaire uniquement pour vLLM en batch serving.
Quelle quantization choisir ?
Q4_K_M pour le développement itératif et les fenêtres longues (262k). Q8_0 si la qualité prime (benchmarks kyuz0 montrent Q8 et Q4 plus rapides que Q5/Q6/Q3 sur Strix Halo). Avec 128 GB, vous pouvez charger les deux et basculer.
Combien coûte l'AI BOX-A395 ?
3 999 $ HT chez MITXPC (août 2026), soit environ 3 435 € HT au taux du 28 août 2026 (1 € = 1,164 $), avant marge du canal européen. La NVIDIA DGX Spark se négocie autour de 4 699 $ HT, soit environ 4 037 € HT, ce qui place l'ASRock environ 15 % en dessous. Distribution en canal industrial B2B (Avnet, Arrow, MITXPC EU), devis obligatoire.
L'ASRock AI BOX-A395 est-il le bon choix pour faire tourner Qwen3.8-27B en local ?

Oui, sous trois conditions. Premièrement, Qwen3.8-27B est multimodal (vision + texte), pas un LLM texte seul : Qwen3.5-27B-Instruct reste le choix pour du texte pur. Deuxièmement, les 128 GB de LPDDR5X-8000 partagée permettent de charger le modèle en Q8 (~30 GB) + un KV cache confortable pour 96k de contexte (~25-30 GB en Q8 KV). Troisièmement, le backend Vulkan de llama.cpp est aujourd'hui plus performant et plus stable que ROCm/HIP sur gfx1151 : commencer par Vulkan, basculer en ROCm si un workload spécifique le demande.

Pourquoi Qwen3.8-27B plutôt qu'un autre modèle 27B ?

Qwen3.8-27B est publié par Alibaba/Qwen le 14 août 2026 sous licence Apache-2.0. C'est un modèle multimodal avec un mécanisme hybride Gated DeltaNet (linear attention) + Gated Attention, contexte natif de 262 144 tokens extensible à 1 000 000 via MTP (Multi-Token Prediction). Pour le VL local, il combine une compréhension image/vidéo et une capacité de raisonnement agentique qui n'existent pas dans Qwen3.5-27B texte pur. Pour du texte pur uniquement, Qwen3.5-27B-Instruct est plus rapide et plus léger.

Combien de tokens par seconde peut-on espérer sur l'AI BOX-A395 ?

Dépend de la quantization et du contexte. Selon kyuz0 (r/LocalLLaMA, Qwen3.5/Qwen3.8 30k contexte, llama.cpp), Qwen3.8-27B Q8 atteint environ 208 tokens par seconde en génération. Selon KyaniteLabs (tuned serving profile, MTP n12 + ngram speculation, 96k contexte), on observe 59.7 tokens/s en cold start et 148-158 tokens/s warm. À 262k contexte, il faut s'attendre à une baisse de throughput proportionnelle (généralement divisée par 3-4 par rapport à 30k).

Le backend ROCm est-il nécessaire ou Vulkan suffit ?

Sur Strix Halo (gfx1151), Vulkan est aujourd'hui le backend recommandé pour llama.cpp : pas de override HSA_OVERRIDE_GFX_VERSION, support natif, performances généralement supérieures à HIP/ROCm. ROCm 7.13 officialise RDNA 3.5 APU, mais pour llama.cpp ou ollama-vulkan, Vulkan reste le chemin de moindre friction. Pour vLLM en batch serving, ROCm est obligatoire et Linux requis (pas de vLLM Windows).

Quels prérequis pour installer Qwen3.8-27B sur l'AI BOX-A395 ?

Trois prérequis. OS : Fedora 41+ ou Ubuntu 24.04 LTS avec kernel 6.13+ (amdgpu upstream stable pour gfx1151), ou Windows 11 + Vulkan si on accepte de ne pas utiliser vLLM. Backend : llama.cpp compilé avec -DGGML_VULKAN=1 (recommandé), vLLM ROCm si serving batch. Modèle : télécharger les GGUFs Unsloth (Q4_K_M pour économiser la VRAM, Q8_0 pour la qualité) depuis huggingface.co/unsloth/Qwen3.8-27B-GGUF.

Combien coûte l'ASRock AI BOX-A395 ?

L'AI BOX-A395 128 GB est listé à 3 999 $ HT chez MITXPC (août 2026), soit environ 3 435 € HT au taux du 28 août 2026 (1 € = 1,164 $), avant marge du canal européen. La NVIDIA DGX Spark se négocie autour de 4 699 $ HT, soit environ 4 037 € HT, ce qui place l'ASRock environ 15 % en dessous. La distribution est en canal industrial B2B (Avnet, Arrow, MITXPC EU) : pas de MSRP public, devis obligatoire.