QDNAVente et intégration de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

Qwen3-Embedding-4B FP8 sur RTX 5080

Mesures réelles du 31 juillet 2026, modèle de plongée servi par vLLM

Réponse courte. Ce couple tient environ 14 100 tok/s sur du texte de 1 024 caractères, monte à 19 075 tok/s sur du texte de 4 096 caractères et plafonne à 46 requêtes par seconde, avec une latence p50 de 21,5 ms à concurrence 4. Il convient à l'indexation RAG à grande échelle sur une seule carte de 16 Go.
ModèleQwen/Qwen3-Embedding-4B (plongée de texte, pas de génération)
FormatFP8
GPUNVIDIA GeForce RTX 5080, 16 Go, architecture Blackwell (sm_120)
RuntimevLLM 0.24.0, torch 2.11.0+cu130, CUDA 13.0, pilote 595.84
Débit en plateau46 requêtes/s et environ 14 100 tok/s sur du texte de 1 024 caractères
Débit maximal96 requêtes/s sur du texte de 256 caractères, 19 075 tok/s sur du texte de 4 096 caractères
Latencep50 de 21,5 ms et p90 de 21,7 ms à concurrence 4 sur 1 024 caractères
Date de mesure31 juillet 2026

Les sept configurations mesurées

Chaque ligne correspond à une série de requêtes envoyées au serveur en production, avec la concurrence indiquée et des textes tirés au hasard. Les débits sont calculés sur la durée totale de la série et les latences sont relevées requête par requête.

ConfigurationConcurrenceRequêtesTaille du texteDurée totaleDébitDébitLatence p50Latence p90
111 requête1 024 caractères33 ms30 requêtes/s9 288 tok/s32,9 ms32,9 ms
2110 requêtes1 024 caractères217 ms46 requêtes/s14 032 tok/s21,6 ms22,0 ms
3420 requêtes1 024 caractères433 ms46 requêtes/s14 173 tok/s21,6 ms22,0 ms
4450 requêtes1 024 caractères1 078 ms46 requêtes/s14 112 tok/s21,5 ms21,8 ms
58100 requêtes1 024 caractères2 157 ms46 requêtes/s14 174 tok/s21,5 ms21,7 ms
6450 requêtes256 caractères518 ms96 requêtes/s7 456 tok/s10,3 ms11,0 ms
7450 requêtes4 096 caractères3 178 ms16 requêtes/s19 075 tok/s63,5 ms64,1 ms

Lecture des mesures

Sur du texte de 1 024 caractères, le serveur sature à 46 requêtes par seconde dès la configuration 2, et ce plafond ne bouge pas quand la concurrence passe de 1 à 8 ni quand la série monte à 100 requêtes. Le débit en jetons reste stable autour de 14 100 tok/s sur tout le plateau, avec une latence p50 qui tient à 21,5 ms sous concurrence 8.

Sur du texte de 256 caractères, le serveur monte à 96 requêtes par seconde mais ne traite que 7 456 tok/s : le coût fixe de chaque requête domine le calcul sur les entrées courtes. Sur du texte de 4 096 caractères, le débit culmine à 19 075 tok/s, ce qui confirme que la carte n'est pas limitée par les poids du modèle. Le facteur limitant aux entrées courtes est le surcoût par requête, entre la file d'attente de vLLM et l'aller-retour client.

Verdict

Ce couple convient à l'indexation RAG en entreprise et au plongée de documents à grande échelle : à 14 100 tok/s soutenus, un corpus de 10 millions de jetons passe en moins de douze minutes sur une carte grand public de 16 Go. Il ne convient pas à la génération de texte, puisque Qwen3-Embedding-4B ne produit que des vecteurs. Pour une précision de recherche supérieure, la variante Qwen3-Embedding-8B au même format est la mesure planifiée suivante sur cette machine.

Procédure de mesure exacte

La mesure a été réalisée le 31 juillet 2026 contre le serveur vLLM en production, exposé en point d'accès compatible OpenAI sur /v1/embeddings. Le script bench-emb.py, écrit en Python avec asyncio et un sémaphore de concurrence, envoie sept configurations dans un ordre tiré au hasard : textes de 256, 1 024 et 4 096 caractères, concurrence de 1, 4 et 8, séries de 1 à 100 requêtes. Les jetons sont ceux comptés par le serveur dans chaque réponse, et les latences sont mesurées côté client, requête par requête.

La machine est un serveur Ubuntu 24.04 équipé d'une NVIDIA GeForce RTX 5080 de 16 Go (Blackwell, sm_120), pilote 595.84, CUDA 13.0, torch 2.11.0+cu130, vLLM 0.24.0. Le modèle Qwen/Qwen3-Embedding-4B est servi en FP8 avec une utilisation mémoire GPU réglée à 0,35. La procédure est reproductible sur toute machine équivalente avec le même script et le même point d'accès.

Limites connues

Pendant la mesure, la carte hébergeait aussi un service de reranking occupant environ 4 Go de mémoire vidéo : les chiffres publiés sont donc prudents par rapport à une carte dédiée. La saturation à 46 requêtes par seconde sur les entrées de 1 024 caractères n'est pas encore expliquée : elle peut venir de la file d'attente de vLLM, du lien PCIe ou du client de mesure, et une mesure de suivi devra trancher. Enfin, ces chiffres datent du 31 juillet 2026 et couvrent un seul serveur ; une autre carte ou une autre version de vLLM peut donner des résultats différents.

Pour aller plus loin

La famille Qwen est présentée dans la fiche Qwen 3.6 et Gemma 4, le serveur utilisé ici dans la fiche vLLM, et la mécanique mémoire qui gouverne ces débits dans le guide matériel : prefill et decode. La matrice de dimensionnement indique quels modèles génératifs tiennent sur chaque machine du catalogue, et la section mesures liste les autres couples mesurés ou planifiés.

Faire mesurer un couple sur votre matériel

Un échange sans engagement pour cadrer la procédure.

Réserver un échange