QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

Comparateur de coût : API au token ou serveur IA sur site ?

À partir de combien d'utilisateurs un serveur IA installé chez vous coûte-t-il moins cher que le paiement au token ? Cet outil applique les hypothèses datées publiées sur ce site, montre chaque formule, et vérifie que la machine choisie tient le débit demandé.

Réponse courte. Avec les hypothèses du site, un DGX Spark amorti sur trois ans coûte environ 164 € HT par mois et devient moins cher que DeepSeek V4 Flash au tarif heures pleines à partir de 55 utilisateurs agentiques ou 309 occasionnels. Changez une hypothèse ci-dessous et le seuil se recalcule. C'est un calcul, pas une mesure.
Vos paramètres
Tarif de l'API, en € HT par million de tokens
Machine sur site

Les formules, telles qu'appliquées

Coût API par utilisateur et par mois = jours ouvrés × (entrée non cachée × tarif entrée + entrée cachée × tarif cache + sortie × tarif sortie), tokens comptés en millions.

Coût sur site par mois = prix d'achat ÷ mois d'amortissement + puissance × 730 h ÷ 1 000 × prix du kWh.

Seuil = coût sur site ÷ coût API par utilisateur. Débit nécessaire = utilisateurs × tokens de sortie par jour × jours ouvrés ÷ secondes de bureau du mois (21 jours de 8 heures). Machines = débit nécessaire ÷ débit agrégé mesuré, arrondi au-dessus.

Hypothèses et sources, datées

Questions fréquentes

Pourquoi le seuil change-t-il autant entre profil agentique et occasionnel ?

Parce que le coût API est proportionnel aux tokens et qu'un utilisateur agentique en consomme vingt fois plus en entrée et dix fois plus en sortie qu'un utilisateur occasionnel. Le coût sur site, lui, ne dépend pas du volume tant que la machine tient le débit, d'où un seuil de 55 utilisateurs dans un cas et de 309 dans l'autre.

Le résultat est-il une mesure ?

Non, c'est un calcul à partir d'hypothèses nommées et datées : prix d'achat relevé, puissance nominale, tarif réglementé, grille API du jour. Une seule mesure entre dans le calcul, le débit agrégé de 59 tokens par seconde relevé par un tiers sur un DGX Spark, et elle sert uniquement au contrôle de capacité.

Que manque-t-il au calcul pour devenir un coût complet ?

Le temps d'ingénierie, l'exploitation, la supervision et les locaux, qui existent dans les deux scénarios mais pas dans les mêmes proportions, et le cache clé-valeur, qui change le débit réel. Notre article sur le choix entre site et API détaille ces réserves et les fiches de dimensionnement donnent la mémoire nécessaire par modèle et par machine.

Pour aller plus loin

Un chiffrage sur vos volumes réels

Un échange sans engagement pour poser vos hypothèses et vos contraintes.

Réserver un échange