Sur site ou API : à partir de combien d'utilisateurs le LLM local est-il rentable ?
Le paiement au token se compare mal à une installation amortie, et voici où se situe le point de bascule et pourquoi le cache clé-valeur change tout.

Deux structures de coût opposées
Une interface facturée à l'usage n'a presque pas de coût fixe, mais un coût qui croît avec chaque token, quand une installation sur site demande un investissement initial élevé puis un coût marginal proche de zéro. Les deux courbes se croisent à un point de bascule qui dépend de l'intensité d'usage.
À partir de combien d’utilisateurs le sur-site devient-il rentable ?
| Effectif | Profil d'usage | Option la moins chère |
|---|---|---|
| Moins de 15 | Occasionnel | Interface au token |
| 15 à 100 | Régulier, agentique | Sur site (bascule) |
| Plus de 100 | Charge continue | Sur site, écart croissant |
Ces seuils restent indicatifs, car la présence de données sensibles impose le sur site quel que soit l'effectif, pour des raisons de conformité et de souveraineté.
Le cache clé-valeur, l'atout du sur site
Les charges agentiques sont dominées par les tokens d'entrée, dans un rapport qui peut atteindre cent pour un. Un prompt système de dix mille tokens envoyé mille fois par jour coûte cher à distance et presque rien en local.
Le moteur d'inférence vLLM réutilise gratuitement le cache de préfixe, si bien que le délai avant le premier token chute fortement lorsqu'un début de conversation se répète, et les boucles répétées deviennent quasi gratuites, là où une interface distante facture le token non mis en cache à un tarif nettement supérieur. La combinaison du cache documentaire et du cache de prompt réduit fortement le coût des scénarios agentiques.
L'hébergement souverain en France
Deux voies existent : le sur site combine l'investissement matériel et l'électricité française, d'origine nucléaire pour une large part, donc stable et bas carbone, quand la colocation infogérée dans un data center souverain français évite l'achat d'un local et conserve la maîtrise juridique, à la différence d'opérateurs soumis à un droit extraterritorial.
Rationaliser sans exposer la donnée
Un socle matériel mutualisé sert l'ensemble des agents, avec des quotas par équipe, et l'innovation sur des données publiques peut déborder vers un service distant, tandis que les données sensibles demeurent en local, ce qui rationalise le coût sans exposer l'information. Le cadre général est présenté dans notre définition de la plateforme IA souveraine.
Le faux local et ses coûts cachés
Une équipe croit parfois fonctionner en local tout en réglant chaque mois une facture d'interface distante. Des retours de terrain donnent des ordres de grandeur parlants, ramenés ici en euros. Une équipe qui se pensait passée au local payait près de 2 400 euros par mois d'appels distants, dont 800 euros pour une simple analyse de sentiment enfouie dans un agent conversationnel. Une jeune entreprise de santé supportait environ 300 euros par mois de frais de conformité liés au cloud. Le remplacement du fournisseur distant par un serveur unique, de l'ordre de 2 000 euros, a ramené ces postes à zéro. L'économie annuelle atteint 28 800 euros dans le premier cas et 3 600 euros dans le second. La règle tient en une phrase : un local partiel reste une dépendance facturée.
Quels leviers réduisent le coût par token ?
Le coût du sur site baisse encore lorsque le moteur d'inférence est réglé, plusieurs leviers se cumulant sans exiger de matériel supplémentaire.
- Le traitement par lots continu augmente le débit de 30 à 100 % à latence égale.
- Le cache de préfixe et de clé-valeur transforme les tokens d'entrée répétés en tokens presque gratuits.
- La quantification loge davantage de modèle sur une même carte graphique, ce qui élève les tokens par seconde et par euro.
- Le décodage spéculatif réduit la latence d'un facteur deux à trois sur les charges conversationnelles.
- Un format d'échange compact entre agents réduit d'environ moitié les tokens consommés. Pour cinq cents agents, l'économie atteint des dizaines de milliers de tokens par requête.
La passerelle unifie plus de mille modèles derrière une seule interface, si bien que le passage d'un fournisseur à l'autre tient en une ligne de configuration, et le surcoût par appel se mesure en microsecondes. Les clés virtuelles fixent un budget et des limites par équipe, tandis que la dépense reste stockée dans votre propre base, sur votre infrastructure en Europe, de sorte que la facture cesse d'être une inconnue.
Questions fréquentes
À partir de combien d'utilisateurs le local est-il rentable ?
Autour de quelques dizaines d'utilisateurs réguliers. En dessous, l'API au token reste moins chère ; au-delà d'une centaine, le sur site l'emporte nettement.
Pourquoi le cache clé-valeur change-t-il le calcul ?
Il rend les préfixes répétés quasi gratuits en local, alors que l'API facture chaque token non mis en cache. Les charges agentiques, dominées par l'entrée, en profitent le plus.
Les données sensibles imposent-elles le sur site ?
Oui, indépendamment du coût : la conformité et la souveraineté imposent le local pour les données sensibles.
Demandez une étude de retour sur investissement
Chiffrage investissement et exploitation, comparatif avec le paiement au token, sur votre volume réel.
Réserver un échange