Qwen3-Embedding-4B FP8 sur RTX 5080
Mesures réelles du 31 juillet 2026, modèle de plongée servi par vLLM
| Modèle | Qwen/Qwen3-Embedding-4B (plongée de texte, pas de génération) |
|---|---|
| Format | FP8 |
| GPU | NVIDIA GeForce RTX 5080, 16 Go, architecture Blackwell (sm_120) |
| Runtime | vLLM 0.24.0, torch 2.11.0+cu130, CUDA 13.0, pilote 595.84 |
| Débit en plateau | 46 requêtes/s et environ 14 100 tok/s sur du texte de 1 024 caractères |
| Débit maximal | 96 requêtes/s sur du texte de 256 caractères, 19 075 tok/s sur du texte de 4 096 caractères |
| Latence | p50 de 21,5 ms et p90 de 21,7 ms à concurrence 4 sur 1 024 caractères |
| Date de mesure | 31 juillet 2026 |
Les sept configurations mesurées
Chaque ligne correspond à une série de requêtes envoyées au serveur en production, avec la concurrence indiquée et des textes tirés au hasard. Les débits sont calculés sur la durée totale de la série et les latences sont relevées requête par requête.
| Configuration | Concurrence | Requêtes | Taille du texte | Durée totale | Débit | Débit | Latence p50 | Latence p90 |
|---|---|---|---|---|---|---|---|---|
| 1 | 1 | 1 requête | 1 024 caractères | 33 ms | 30 requêtes/s | 9 288 tok/s | 32,9 ms | 32,9 ms |
| 2 | 1 | 10 requêtes | 1 024 caractères | 217 ms | 46 requêtes/s | 14 032 tok/s | 21,6 ms | 22,0 ms |
| 3 | 4 | 20 requêtes | 1 024 caractères | 433 ms | 46 requêtes/s | 14 173 tok/s | 21,6 ms | 22,0 ms |
| 4 | 4 | 50 requêtes | 1 024 caractères | 1 078 ms | 46 requêtes/s | 14 112 tok/s | 21,5 ms | 21,8 ms |
| 5 | 8 | 100 requêtes | 1 024 caractères | 2 157 ms | 46 requêtes/s | 14 174 tok/s | 21,5 ms | 21,7 ms |
| 6 | 4 | 50 requêtes | 256 caractères | 518 ms | 96 requêtes/s | 7 456 tok/s | 10,3 ms | 11,0 ms |
| 7 | 4 | 50 requêtes | 4 096 caractères | 3 178 ms | 16 requêtes/s | 19 075 tok/s | 63,5 ms | 64,1 ms |
Lecture des mesures
Sur du texte de 1 024 caractères, le serveur sature à 46 requêtes par seconde dès la configuration 2, et ce plafond ne bouge pas quand la concurrence passe de 1 à 8 ni quand la série monte à 100 requêtes. Le débit en jetons reste stable autour de 14 100 tok/s sur tout le plateau, avec une latence p50 qui tient à 21,5 ms sous concurrence 8.
Sur du texte de 256 caractères, le serveur monte à 96 requêtes par seconde mais ne traite que 7 456 tok/s : le coût fixe de chaque requête domine le calcul sur les entrées courtes. Sur du texte de 4 096 caractères, le débit culmine à 19 075 tok/s, ce qui confirme que la carte n'est pas limitée par les poids du modèle. Le facteur limitant aux entrées courtes est le surcoût par requête, entre la file d'attente de vLLM et l'aller-retour client.
Verdict
Ce couple convient à l'indexation RAG en entreprise et au plongée de documents à grande échelle : à 14 100 tok/s soutenus, un corpus de 10 millions de jetons passe en moins de douze minutes sur une carte grand public de 16 Go. Il ne convient pas à la génération de texte, puisque Qwen3-Embedding-4B ne produit que des vecteurs. Pour une précision de recherche supérieure, la variante Qwen3-Embedding-8B au même format est la mesure planifiée suivante sur cette machine.
Procédure de mesure exacte
La mesure a été réalisée le 31 juillet 2026 contre le serveur vLLM en production, exposé en point d'accès compatible OpenAI sur /v1/embeddings. Le script bench-emb.py, écrit en Python avec asyncio et un sémaphore de concurrence, envoie sept configurations dans un ordre tiré au hasard : textes de 256, 1 024 et 4 096 caractères, concurrence de 1, 4 et 8, séries de 1 à 100 requêtes. Les jetons sont ceux comptés par le serveur dans chaque réponse, et les latences sont mesurées côté client, requête par requête.
La machine est un serveur Ubuntu 24.04 équipé d'une NVIDIA GeForce RTX 5080 de 16 Go (Blackwell, sm_120), pilote 595.84, CUDA 13.0, torch 2.11.0+cu130, vLLM 0.24.0. Le modèle Qwen/Qwen3-Embedding-4B est servi en FP8 avec une utilisation mémoire GPU réglée à 0,35. La procédure est reproductible sur toute machine équivalente avec le même script et le même point d'accès.
Limites connues
Pendant la mesure, la carte hébergeait aussi un service de reranking occupant environ 4 Go de mémoire vidéo : les chiffres publiés sont donc prudents par rapport à une carte dédiée. La saturation à 46 requêtes par seconde sur les entrées de 1 024 caractères n'est pas encore expliquée : elle peut venir de la file d'attente de vLLM, du lien PCIe ou du client de mesure, et une mesure de suivi devra trancher. Enfin, ces chiffres datent du 31 juillet 2026 et couvrent un seul serveur ; une autre carte ou une autre version de vLLM peut donner des résultats différents.
Pour aller plus loin
La famille Qwen est présentée dans la fiche Qwen 3.6 et Gemma 4, le serveur utilisé ici dans la fiche vLLM, et la mécanique mémoire qui gouverne ces débits dans le guide matériel : prefill et decode. La matrice de dimensionnement indique quels modèles génératifs tiennent sur chaque machine du catalogue, et la section mesures liste les autres couples mesurés ou planifiés.
Faire mesurer un couple sur votre matériel
Un échange sans engagement pour cadrer la procédure.
Réserver un échange