QDNAVente et intégration de plateformes d'inférence et d'entraînement de LLM, en local ou hybride
Architecture

Mesures réelles d'inférence

Des chiffres mesurés sur du matériel réel, un couple modèle, format et GPU par page, avec la procédure qui permet de les reproduire.

Méthode

Chaque page de cette section publie les mesures d'un seul couple : un modèle ouvert, dans un format de quantification donné, sur une machine donnée. Les chiffres proviennent d'un script de mesure dont la procédure complète figure dans chaque page, de sorte que tout lecteur puisse les vérifier sur une machine équivalente. Aucun chiffre n'est extrapolé, recopié d'un tiers ou calculé : quand une mesure n'existe pas encore, le couple reste listé comme planifié, sans valeur.

Ces mesures complètent la matrice de dimensionnement, qui est calculée : elle dit si un modèle tient en mémoire, quand les pages de cette section disent ce que la machine délivre réellement en débit et en latence.

Mesures publiées

Mesures planifiées

Neuf couples supplémentaires sont planifiés. Ils seront publiés au fil des mesures, au fur et à mesure de l'accès aux machines concernées, sans aucune valeur annoncée à l'avance.

ModèleFormatMachineStatut
Qwen3-VL-Reranker-2BFP16RTX 5080mesure planifiée
Mistral Small 3.1 24BFP8Serveur RTX PRO 6000mesure planifiée
Mistral Small 3.1 24BFP8Serveur H200 SXMmesure planifiée
GLM 5.2FP8B200 SXMmesure planifiée
Kimi K3FP8B300 SXMmesure planifiée
DeepSeek V4NVFP4GB300 NVL72mesure planifiée
Qwen3 8BFP8Mac Studio Ultramesure planifiée
Qwen3 4BFP8DGX Sparkmesure planifiée
Qwen3-Embedding-8BFP8RTX 5080mesure planifiée

Un couple absent de cette liste peut faire l'objet d'une mesure à la demande, sur votre matériel ou sur une machine de référence : la page à propos décrit la démarche et le formulaire de contact permet de cadrer la procédure.