Comparateur de coût : API au token ou serveur IA sur site ?
À partir de combien d'utilisateurs un serveur IA installé chez vous coûte-t-il moins cher que le paiement au token ? Cet outil applique les hypothèses datées publiées sur ce site, montre chaque formule, et vérifie que la machine choisie tient le débit demandé.
Les formules, telles qu'appliquées
Coût API par utilisateur et par mois = jours ouvrés × (entrée non cachée × tarif entrée + entrée cachée × tarif cache + sortie × tarif sortie), tokens comptés en millions.
Coût sur site par mois = prix d'achat ÷ mois d'amortissement + puissance × 730 h ÷ 1 000 × prix du kWh.
Seuil = coût sur site ÷ coût API par utilisateur. Débit nécessaire = utilisateurs × tokens de sortie par jour × jours ouvrés ÷ secondes de bureau du mois (21 jours de 8 heures). Machines = débit nécessaire ÷ débit agrégé mesuré, arrondi au-dessus.
Hypothèses et sources, datées
- Grille DeepSeek V4 Flash du 2 septembre 2026, heures pleines : 0,44 $ par million de tokens d'entrée non cachés, 0,014 $ cachés, 1,32 $ en sortie ; heures creuses moitié prix. Convertis au taux 1 € = 1,159 $ (BCE, 1er septembre 2026).
- DGX Spark Founders Edition : 4 875 € HT, meilleur prix idealo.fr relevé le 2 septembre 2026, amorti linéairement sur 36 mois. 240 W est l'alimentation nominale de la fiche NVIDIA, hypothèse haute : ServeTheHome mesure 60 à 200 W en charge.
- Électricité : Tarif Bleu professionnel EDF, option Base, grille du 1er août 2026, 0,1624 € HT le kWh, délibération CRE 2026-147.
- Débit agrégé de 59 tokens par seconde à douze requêtes simultanées pour DeepSeek V4 Flash sur un DGX Spark : relevé Entrpi, moteur DSpark, forum NVIDIA, 15 juillet 2026. C'est une mesure d'un tiers, sur une configuration précise.
- DGX Station : 95 000 € HT (Exxact, relevé du 27 août 2026), puissance et débit non mesurés par ce site, à renseigner.
- Ne sont pas comptés : intégration, exploitation, temps d'ingénierie, locaux, et le coût d'opportunité d'un modèle qui n'existe pas en poids ouverts.
Questions fréquentes
Pourquoi le seuil change-t-il autant entre profil agentique et occasionnel ?
Parce que le coût API est proportionnel aux tokens et qu'un utilisateur agentique en consomme vingt fois plus en entrée et dix fois plus en sortie qu'un utilisateur occasionnel. Le coût sur site, lui, ne dépend pas du volume tant que la machine tient le débit, d'où un seuil de 55 utilisateurs dans un cas et de 309 dans l'autre.
Le résultat est-il une mesure ?
Non, c'est un calcul à partir d'hypothèses nommées et datées : prix d'achat relevé, puissance nominale, tarif réglementé, grille API du jour. Une seule mesure entre dans le calcul, le débit agrégé de 59 tokens par seconde relevé par un tiers sur un DGX Spark, et elle sert uniquement au contrôle de capacité.
Que manque-t-il au calcul pour devenir un coût complet ?
Le temps d'ingénierie, l'exploitation, la supervision et les locaux, qui existent dans les deux scénarios mais pas dans les mêmes proportions, et le cache clé-valeur, qui change le débit réel. Notre article sur le choix entre site et API détaille ces réserves et les fiches de dimensionnement donnent la mémoire nécessaire par modèle et par machine.
Pour aller plus loin
- Sur site ou API : le calcul complet et ses réserves
- Quel serveur IA, à quel prix
- Fiche DGX Spark
- Dimensionnement modèle par machine
Un chiffrage sur vos volumes réels
Un échange sans engagement pour poser vos hypothèses et vos contraintes.
Réserver un échange