Servir Qwen 3.6 27B avec Triton Inference Server
Qwen 3.6 27B compte 27 milliards de paramètres. Triton Inference Server vise mise en service industrielle, multi-modèles. Cette page donne la mémoire nécessaire et les plateformes qui conviennent.
Quelle mémoire faut-il au minimum ?
Qwen 3.6 27B totalise 27 milliards de paramètres. En NVFP4, ses poids occupent environ 15,5 Go, marge d’exécution comprise. En FP8 l’empreinte double, à environ 31,0 Go. Le cache d’attention s’ajoute et dépend du contexte servi.
À quoi sert Triton Inference Server ?
Triton Inference Server vise mise en service industrielle, multi-modèles. Voir la fiche Triton Inference Server et la fiche Qwen 3.6 27B.
Sur quelles plateformes ?
- Qwen 3.6 27B sur DGX Spark
- Qwen 3.6 27B sur Mac Studio Ultra
- Qwen 3.6 27B sur DGX Station
- Qwen 3.6 27B sur Serveur RTX PRO 6000
- Qwen 3.6 27B sur Serveur H200 SXM
- Qwen 3.6 27B sur B200 SXM
Quelle mémoire pour Qwen 3.6 27B avec Triton Inference Server ?
Environ 15,5 Go en NVFP4 pour les poids, hors cache d’attention.
Triton Inference Server convient-il à Qwen 3.6 27B ?
Triton Inference Server sert Qwen 3.6 27B dès lors que la machine offre au moins 15,5 Go de mémoire, empreinte des poids en NVFP4. 8 des 8 plateformes du catalogue y parviennent.
Méthode
Les valeurs proviennent des fiches du site. Les empreintes mémoire sont calculées, elles ne sont pas mesurées : un relevé sur machine peut s’en écarter selon le moteur et le format exact des poids. Les prix sont indicatifs et non contractuels.