ASRock AI BOX-A395 + Qwen3.8-27B : 256K de contexte sur Strix Halo 128 GB
L'ASRock AI BOX-A395 (Ryzen AI Max+ 395, Radeon 8060S, 128 GB de LPDDR5X-8000 partagée) fait tourner Qwen3.8-27B multimodal en local, et voici les mesures de débit, le dimensionnement du cache KV, les fenêtres de contexte de 262k natives extensibles à 1 M, le comparatif des systèmes et les prix.
Le contexte
Le Strix Halo (Ryzen AI Max+ 395) est un cas particulier dans le paysage du local LLM : un APU avec un iGPU Radeon 8060S (RDNA 3.5, 40 CU) et jusqu'à 128 GB de LPDDR5X unifiée entre CPU, GPU et NPU. C'est la même mémoire qui sert de VRAM à l'iGPU via le mécanisme GTT (Graphics Translation Table).
ASRock Industrial a industrialisé cette puce dans l'AI BOX-A395, un boîtier compact d'IA de périphérie, que nous avons évalué sur Qwen3.8-27B, le multimodal vision-language publié par Alibaba/Qwen le 14 août 2026 sous licence Apache-2.0.
Spécifications de l'AI BOX-A395
| Composant | Détail |
|---|---|
| APU | AMD Ryzen AI Max+ 395 (Strix Halo), 16 cœurs / 32 threads, Zen 5 + Zen 5c, jusqu'à 5.1 GHz |
| iGPU | Radeon 8060S, RDNA 3.5, 40 CU, gfx1151 |
| NPU | XDNA 2, ~50 TOPS INT8 |
| Mémoire | 128 GB LPDDR5X-8000 unifiée CPU/GPU/NPU (version 128 GB) |
| Stockage | 1 × M.2 2280 NVMe PCIe |
| Réseau | 10 GbE (selon configuration), WiFi 6E/7 optionnel |
| Ports USB | 2 × USB4, 1 × USB-C 3.2 Gen2, 2 × USB-A 3.2 Gen2, 2 × USB-A 2.0 |
| Alimentation | AC 100-240 V, 400 W (intégré) |
| OS supportés | Windows 11, Linux (Ubuntu 24.04 LTS, Fedora 41+) |
Sources : fiche ASRock Industrial, Electronics-Lab coverage.
Qwen3.8-27B : multimodal Apache-2.0
Qwen3.8-27B est publié le 14 août 2026 par Alibaba/Qwen, sous licence Apache-2.0. C'est un modèle multimodal vision-language (image + vidéo + texte), basé sur une architecture hybride Gated DeltaNet (linear attention) + Gated Attention.
| Paramètre | Valeur (config.json) |
|---|---|
| Paramètres totaux | 27 B (dense) |
| Hidden dimension | 5120 |
| Couches | 64 |
| Têtes attention (Q) | 24 |
| Têtes KV (GQA) | 4 |
| Head dim attention | 256 |
| Head dim linear (DeltaNet) | 128 (V:48 têtes, QK:16 têtes) |
| FFN intermediate | 17 408 |
| Vocab size | 248 320 |
| Context natif | 262 144 tokens (extensible à 1 000 000 via MTP) |
| Layout | 16 × (3 × (DeltaNet → FFN) → 1 × (Attention → FFN)) |
| Multi-Token Prediction (MTP) | Oui, entraîné multi-étapes |
Source : huggingface.co/Qwen/Qwen3.8-27B : config.json verbatim.
Prérequis ROCm / Vulkan
Sur Strix Halo, deux approches coexistent pour llama.cpp :
- Vulkan (recommandé en 2026) : support natif gfx1151, pas de HSA_OVERRIDE_GFX_VERSION, performances généralement supérieures à HIP/ROCm. Ollama-vulkan, LM Studio, llama.cpp Vulkan se partagent le même backend.
- ROCm / HIP : nécessaire pour vLLM en batch serving. ROCm 7.13 officialise RDNA 3.5 APU. Toujours utiliser
HSA_OVERRIDE_GFX_VERSION=11.5.1sauf si ROCm 7.14+ détecte gfx1151 nativement.
Sur Fedora 41+ ou Ubuntu 24.04 LTS avec un noyau 6.13 ou plus récent, la commande rocminfo | grep gfx1151 doit retourner le périphérique. Sur Windows 11, vLLM n'est pas disponible, mais Vulkan fonctionne sans réglage préalable via LM Studio ou Ollama-vulkan.
Sources : ROCm 7.13 Expanding Hardware, llama.cpp Strix Halo build, NixOS Discourse.
Benchmarks mesurés
96k n'est pas le plafond de la machine, c'est le point où le profil de service publié a été mesuré. Le tableau du cache KV plus bas montre que le contexte natif de 262 144 tokens tient à 48 % de la mémoire (modèle Q8 30 GB + cache KV Q8 32 GB = 62 GB sur 128). Les débits ci-dessous valent donc pour 96k ; à 256K, attendez-vous à une baisse proportionnelle au volume de cache relu, sans que la mémoire devienne le facteur limitant.
Deux sources communautaires publient des benchmarks mesurés sur Qwen3.8-27B sur Strix Halo 128 GB :
| Source | Configuration | Throughput |
|---|---|---|
| kyuz0 (r/LocalLLaMA, Q8/Q4 30k contexte, llama.cpp) | Qwen3.8-27B Q8 / Q4_K_M | ~208.42 tokens/s (génération, 30k ctx) |
| KyaniteLabs (tuned serving profile, MTP n12 + ngram speculation) | Qwen3.8-27B Q8, llama.cpp Vulkan | 59.7 tok/s cold, 148-158 tok/s warm @ 96k ctx |
Le Q4 est plus rapide que le Q8 en tokens par seconde, mais le Q8 conserve une marge sur les bancs de qualité que sont MMLU, GPQA et le code. À 96k de contexte, la montée en régime prend une à deux minutes, le temps de charger le cache KV, après quoi le débit se stabilise.
Sources : kyuz0 r/LocalLLaMA benchmark, KyaniteLabs/qwen38-27b-strix-halo.
KV cache et fenêtres de contexte
Le KV cache de Qwen3.8-27B est dominé par les 4 têtes KV (GQA, 256 head_dim). Par token, en FP16 : 2 × 64 × 4 × 256 × 2 = 262 144 octets (~256 KiB/token).
| Contexte | FP16 | Q8 | Q4 |
|---|---|---|---|
| 32 768 (32k) | ~8.0 GiB | ~4.0 GiB | ~2.0 GiB |
| 65 536 (64k) | ~16.0 GiB | ~8.0 GiB | ~4.0 GiB |
| 131 072 (128k) | ~32.0 GiB | ~16.0 GiB | ~8.0 GiB |
| 262 144 (262k natif) | ~64.0 GiB | ~32.0 GiB | ~16.0 GiB |
Avec 128 GB partagés : modèle Q8 (30 GB) + KV Q8 (32 GB à 262k) = 62 GB sur 128, soit 48 % d'utilisation. Largement de quoi faire tourner en parallèle d'autres outils, ou de réserver la mémoire au KV cache pour des fenêtres plus longues.
Sources : config.json Qwen3.8-27B, kyuz0 amd-strix-halo-toolboxes.
Windows vs Linux
Pour Qwen3.8-27B multimodal, Vulkan est aujourd'hui le chemin de moindre friction, et la matrice suivante résume les options disponibles :
| OS | Backend | vLLM | Usage recommandé |
|---|---|---|---|
| Windows 11 | Vulkan (LM Studio, Ollama-vulkan, llama.cpp) | ❌ | Développement interactif, multimodal |
| Linux (Fedora 41+, Ubuntu 24.04 HWE) | Vulkan ou ROCm | ✅ ROCm | Serving batch, multimodal, multimodal agentique |
Pour une station de travail AI BOX-A395, Linux Fedora 41+ avec un noyau 6.14 ou plus récent est la cible privilégiée, avec vLLM, llama.cpp Vulkan, ROCm-SMI pour la supervision et l'accès BIOS à l'allocation de l'iGPU, tandis que Windows 11 reste valide pour un usage interactif via LM Studio, sans vLLM.
Source : KyaniteLabs/qwen38-27b-strix-halo.
Comparatif prix
L'AI BOX-A395 128 GB est listé à 3 999 $ HT chez MITXPC (intégrateur américain, tarif d'août 2026), soit environ 3 435 € HT au taux du 28 août 2026 (1 € = 1,164 $), avant la marge du canal de distribution européen (Avnet, Arrow, MITXPC EU). La NVIDIA DGX Spark se négocie aujourd'hui autour de 4 699 $ HT après la hausse liée à la mémoire, soit environ 4 037 € HT, ce qui place l'ASRock environ 15 % en dessous.
| Machine | RAM unifiée | Prix indicatif 2026 | Usage |
|---|---|---|---|
| ASRock AI BOX-A395 | 128 GB LPDDR5X partagée | ~3 435 € HT (3 999 $) | Edge AI compact, multimodal local |
| Nvidia DGX Spark | 128 GB unifiée | ~4 037 € HT (4 699 $) | CUDA, vLLM natif |
| Framework Desktop | 128 GB | ~1 900 € HT (frame seul) | DIY modulaire |
| HP Z2 Mini G1a (Ryzen AI Max PRO) | 128 GB | ~2 500 € – 3 500 € HT | Workstation ECC |
| Minisforum MS-S1 MAX | 128 GB | ~1 500 € – 1 900 € HT | Mini-ITX alternative |
| Mac Studio M5 Ultra | 96 GB de base, jusqu'à 512 GB | à partir de ~5 499 € HT (6 599 € TTC) | 1,2 To/s, plus rapide en MLX pur |
Pour Qwen3.8-27B multimodal, l'AI BOX-A395 se place environ 15 % sous le DGX Spark au tarif courant, avec les avantages et les inconvénients inverses : le DGX Spark a CUDA et vLLM natif, quand l'AI BOX-A395 a ROCm en cours d'officialisation et Vulkan dès aujourd'hui. Le Mac Studio M5 Ultra, à partir de 6 599 € TTC soit environ 5 499 € HT, coûte sensiblement plus cher, mais il monte à 512 Go de mémoire unifiée servie à 1,2 To/s, pour une compatibilité vision moins bonne.
Sources : MITXPC (3 999,95 $ HT), HP Z2 Mini G1a, LinuxGizmos coverage.
Limites de cet article
Les chiffres t/s à 262k contexte (limite native de Qwen3.8-27B) et 1 M de tokens (extension MTP) restent à mesurer sur l'AI BOX-A395 spécifiquement. La communauté publie régulièrement sur r/StrixHalo et r/LocalLLaMA : à mesure que des benchmarks plus poussés arrivent (ETA Prime, Phoronix), nous mettons cet article à jour.
L'AI BOX-A395 est commercialisé par le canal industriel entre professionnels, si bien que le prix catalogue n'est pas public et qu'un devis reste nécessaire, les estimations de marché ci-dessus n'étant fournies qu'à titre indicatif.
Sources officielles
- ASRock Industrial : AI BOX-A395 (fiche produit)
- Qwen/Qwen3.8-27B : Hugging Face (model card)
- unsloth/Qwen3.8-27B-GGUF (quants)
- AMD Ryzen AI Max+ 395
- AMD ROCm 7.13 : Expanding Hardware and Reach
- ROCm system-optimization RDNA 3.5
- llama.cpp : Strix Halo gfx1151 build
- KyaniteLabs/qwen38-27b-strix-halo : tuned serving profile
- Phoronix : ROCm 7.9 Strix Halo early tests
- r/LocalLLaMA : Qwen3.5/3.8 benchmarks Strix Halo
- kyuz0 amd-strix-halo-toolboxes dashboard
Questions fréquentes
L'ASRock AI BOX-A395 est-il le bon choix pour Qwen3.8-27B ?
Qwen3.8-27B ou Qwen3.5-27B-Instruct ?
ROCm ou Vulkan pour llama.cpp ?
Quelle quantization choisir ?
Combien coûte l'AI BOX-A395 ?
L'ASRock AI BOX-A395 est-il le bon choix pour faire tourner Qwen3.8-27B en local ?
Oui, sous trois conditions. Premièrement, Qwen3.8-27B est multimodal (vision + texte), pas un LLM texte seul : Qwen3.5-27B-Instruct reste le choix pour du texte pur. Deuxièmement, les 128 GB de LPDDR5X-8000 partagée permettent de charger le modèle en Q8 (~30 GB) + un KV cache confortable pour 96k de contexte (~25-30 GB en Q8 KV). Troisièmement, le backend Vulkan de llama.cpp est aujourd'hui plus performant et plus stable que ROCm/HIP sur gfx1151 : commencer par Vulkan, basculer en ROCm si un workload spécifique le demande.
Pourquoi Qwen3.8-27B plutôt qu'un autre modèle 27B ?
Qwen3.8-27B est publié par Alibaba/Qwen le 14 août 2026 sous licence Apache-2.0. C'est un modèle multimodal avec un mécanisme hybride Gated DeltaNet (linear attention) + Gated Attention, contexte natif de 262 144 tokens extensible à 1 000 000 via MTP (Multi-Token Prediction). Pour le VL local, il combine une compréhension image/vidéo et une capacité de raisonnement agentique qui n'existent pas dans Qwen3.5-27B texte pur. Pour du texte pur uniquement, Qwen3.5-27B-Instruct est plus rapide et plus léger.
Combien de tokens par seconde peut-on espérer sur l'AI BOX-A395 ?
Dépend de la quantization et du contexte. Selon kyuz0 (r/LocalLLaMA, Qwen3.5/Qwen3.8 30k contexte, llama.cpp), Qwen3.8-27B Q8 atteint environ 208 tokens par seconde en génération. Selon KyaniteLabs (tuned serving profile, MTP n12 + ngram speculation, 96k contexte), on observe 59.7 tokens/s en cold start et 148-158 tokens/s warm. À 262k contexte, il faut s'attendre à une baisse de throughput proportionnelle (généralement divisée par 3-4 par rapport à 30k).
Le backend ROCm est-il nécessaire ou Vulkan suffit ?
Sur Strix Halo (gfx1151), Vulkan est aujourd'hui le backend recommandé pour llama.cpp : pas de override HSA_OVERRIDE_GFX_VERSION, support natif, performances généralement supérieures à HIP/ROCm. ROCm 7.13 officialise RDNA 3.5 APU, mais pour llama.cpp ou ollama-vulkan, Vulkan reste le chemin de moindre friction. Pour vLLM en batch serving, ROCm est obligatoire et Linux requis (pas de vLLM Windows).
Quels prérequis pour installer Qwen3.8-27B sur l'AI BOX-A395 ?
Trois prérequis. OS : Fedora 41+ ou Ubuntu 24.04 LTS avec kernel 6.13+ (amdgpu upstream stable pour gfx1151), ou Windows 11 + Vulkan si on accepte de ne pas utiliser vLLM. Backend : llama.cpp compilé avec -DGGML_VULKAN=1 (recommandé), vLLM ROCm si serving batch. Modèle : télécharger les GGUFs Unsloth (Q4_K_M pour économiser la VRAM, Q8_0 pour la qualité) depuis huggingface.co/unsloth/Qwen3.8-27B-GGUF.
Combien coûte l'ASRock AI BOX-A395 ?
L'AI BOX-A395 128 GB est listé à 3 999 $ HT chez MITXPC (août 2026), soit environ 3 435 € HT au taux du 28 août 2026 (1 € = 1,164 $), avant marge du canal européen. La NVIDIA DGX Spark se négocie autour de 4 699 $ HT, soit environ 4 037 € HT, ce qui place l'ASRock environ 15 % en dessous. La distribution est en canal industrial B2B (Avnet, Arrow, MITXPC EU) : pas de MSRP public, devis obligatoire.