QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

Sur site ou API : à partir de combien d'utilisateurs le LLM local est-il rentable ?

Le paiement au token se compare mal à une installation amortie, et voici où se situe le point de bascule et pourquoi le cache clé-valeur change tout.

Sur site ou API : à partir de combien d'utilisateurs le LLM local est-il rentable ?
Réponse courte. Le point de bascule se situe autour de quelques dizaines d'utilisateurs réguliers. En dessous d'une quinzaine d'utilisateurs occasionnels, le paiement au token reste moins cher. Entre une quinzaine et une centaine d'utilisateurs, le sur site devient avantageux grâce au cache clé-valeur gratuit. Au-delà d'une centaine en charge continue, l'écart se creuse nettement en faveur du sur site.

Deux structures de coût opposées

Une interface facturée à l'usage n'a presque pas de coût fixe, mais un coût qui croît avec chaque token, quand une installation sur site demande un investissement initial élevé puis un coût marginal proche de zéro. Les deux courbes se croisent à un point de bascule qui dépend de l'intensité d'usage.

À partir de combien d’utilisateurs le sur-site devient-il rentable ?

EffectifProfil d'usageOption la moins chère
Moins de 15OccasionnelInterface au token
15 à 100Régulier, agentiqueSur site (bascule)
Plus de 100Charge continueSur site, écart croissant

Ces seuils restent indicatifs, car la présence de données sensibles impose le sur site quel que soit l'effectif, pour des raisons de conformité et de souveraineté.

Le cache clé-valeur, l'atout du sur site

Les charges agentiques sont dominées par les tokens d'entrée, dans un rapport qui peut atteindre cent pour un. Un prompt système de dix mille tokens envoyé mille fois par jour coûte cher à distance et presque rien en local.

Le moteur d'inférence vLLM réutilise gratuitement le cache de préfixe, si bien que le délai avant le premier token chute fortement lorsqu'un début de conversation se répète, et les boucles répétées deviennent quasi gratuites, là où une interface distante facture le token non mis en cache à un tarif nettement supérieur. La combinaison du cache documentaire et du cache de prompt réduit fortement le coût des scénarios agentiques.

L'hébergement souverain en France

Deux voies existent : le sur site combine l'investissement matériel et l'électricité française, d'origine nucléaire pour une large part, donc stable et bas carbone, quand la colocation infogérée dans un data center souverain français évite l'achat d'un local et conserve la maîtrise juridique, à la différence d'opérateurs soumis à un droit extraterritorial.

Rationaliser sans exposer la donnée

Un socle matériel mutualisé sert l'ensemble des agents, avec des quotas par équipe, et l'innovation sur des données publiques peut déborder vers un service distant, tandis que les données sensibles demeurent en local, ce qui rationalise le coût sans exposer l'information. Le cadre général est présenté dans notre définition de la plateforme IA souveraine.

Le faux local et ses coûts cachés

Une équipe croit parfois fonctionner en local tout en réglant chaque mois une facture d'interface distante. Des retours de terrain donnent des ordres de grandeur parlants, ramenés ici en euros. Une équipe qui se pensait passée au local payait près de 2 400 euros par mois d'appels distants, dont 800 euros pour une simple analyse de sentiment enfouie dans un agent conversationnel. Une jeune entreprise de santé supportait environ 300 euros par mois de frais de conformité liés au cloud. Le remplacement du fournisseur distant par un serveur unique, de l'ordre de 2 000 euros, a ramené ces postes à zéro. L'économie annuelle atteint 28 800 euros dans le premier cas et 3 600 euros dans le second. La règle tient en une phrase : un local partiel reste une dépendance facturée.

Quels leviers réduisent le coût par token ?

Le coût du sur site baisse encore lorsque le moteur d'inférence est réglé, plusieurs leviers se cumulant sans exiger de matériel supplémentaire.

La passerelle unifie plus de mille modèles derrière une seule interface, si bien que le passage d'un fournisseur à l'autre tient en une ligne de configuration, et le surcoût par appel se mesure en microsecondes. Les clés virtuelles fixent un budget et des limites par équipe, tandis que la dépense reste stockée dans votre propre base, sur votre infrastructure en Europe, de sorte que la facture cesse d'être une inconnue.

Questions fréquentes

À partir de combien d'utilisateurs le local est-il rentable ?

Autour de quelques dizaines d'utilisateurs réguliers. En dessous, l'API au token reste moins chère ; au-delà d'une centaine, le sur site l'emporte nettement.

Pourquoi le cache clé-valeur change-t-il le calcul ?

Il rend les préfixes répétés quasi gratuits en local, alors que l'API facture chaque token non mis en cache. Les charges agentiques, dominées par l'entrée, en profitent le plus.

Les données sensibles imposent-elles le sur site ?

Oui, indépendamment du coût : la conformité et la souveraineté imposent le local pour les données sensibles.

Demandez une étude de retour sur investissement

Chiffrage investissement et exploitation, comparatif avec le paiement au token, sur votre volume réel.

Réserver un échange

Références