Méthode
Chaque page de cette section publie les mesures d'un seul couple : un modèle ouvert, dans un format de quantification donné, sur une machine donnée. Les chiffres proviennent d'un script de mesure dont la procédure complète figure dans chaque page, de sorte que tout lecteur puisse les vérifier sur une machine équivalente. Aucun chiffre n'est extrapolé, recopié d'un tiers ou calculé : quand une mesure n'existe pas encore, le couple reste listé comme planifié, sans valeur.
Ces mesures complètent la matrice de dimensionnement, qui est calculée : elle dit si un modèle tient en mémoire, quand les pages de cette section disent ce que la machine délivre réellement en débit et en latence.
Mesures publiées
- Qwen3-Embedding-4B en FP8 sur RTX 5080, mesuré le 31 juillet 2026 : 14 100 tok/s en plateau, 19 075 tok/s sur texte long, 46 requêtes par seconde en saturation.
Mesures planifiées
Neuf couples supplémentaires sont planifiés. Ils seront publiés au fil des mesures, au fur et à mesure de l'accès aux machines concernées, sans aucune valeur annoncée à l'avance.
| Modèle | Format | Machine | Statut |
|---|---|---|---|
| Qwen3-VL-Reranker-2B | FP16 | RTX 5080 | mesure planifiée |
| Mistral Small 3.1 24B | FP8 | Serveur RTX PRO 6000 | mesure planifiée |
| Mistral Small 3.1 24B | FP8 | Serveur H200 SXM | mesure planifiée |
| GLM 5.2 | FP8 | B200 SXM | mesure planifiée |
| Kimi K3 | FP8 | B300 SXM | mesure planifiée |
| DeepSeek V4 | NVFP4 | GB300 NVL72 | mesure planifiée |
| Qwen3 8B | FP8 | Mac Studio Ultra | mesure planifiée |
| Qwen3 4B | FP8 | DGX Spark | mesure planifiée |
| Qwen3-Embedding-8B | FP8 | RTX 5080 | mesure planifiée |
Un couple absent de cette liste peut faire l'objet d'une mesure à la demande, sur votre matériel ou sur une machine de référence : la page à propos décrit la démarche et le formulaire de contact permet de cadrer la procédure.