Secteurs : LLM local et conformité
Le cadre réglementaire varie selon le secteur, la question du transfert de données ne varie pas.
Réponse courte. Un modèle servi sur site traite les données sur place. Aucune donnée ne sort du système d’information, ce qui retire la question du transfert vers un tiers.
Par secteur
- La santé, cadre HDS et RGPD
- La finance, cadre DORA et RGPD
- Le secteur public, cadre RGPD et SecNumCloud
- L’industrie, cadre RGPD
- Le secteur juridique, cadre RGPD et secret professionnel
Ce que ces pages ne disent pas
Elles décrivent une architecture et ne constituent pas un avis juridique. La conformité s’apprécie sur le traitement réel, avec le délégué à la protection des données de l’organisation.
Méthode et sources
Les empreintes sont calculées : milliards de paramètres × octets par paramètre du format × 1,15 de marge d’exécution. Elles ne sont pas mesurées sur machine. Le cache d’attention s’ajoute et dépend du contexte et de la concurrence. Les prix sont indicatifs et non contractuels. Chaque page de détail porte ses sources ; les conventions communes sont celles-ci.
- Octets par paramètre : FP16 2 (16 bits par paramètre, soit 2 octets) ; FP8 1 (8 bits par paramètre (E4M3), soit 1 octet, échelles par bloc non comptées) ; NVFP4 0,5 (4 bits par paramètre, soit 0,5 octet ; les poids publiés en 4 bits pèsent 0,54 à 0,56 octet par paramètre avec leurs échelles (DeepSeek V4 Pro 865 Go pour 1 599 milliards, Kimi K3 1 561 Go pour 2 780 milliards)) ; Q4 0,6 (entendu ici comme Q4_K_M de llama.cpp, 0,6 octet par paramètre échelles comprises ; Q4_K_S pèse 0,56, AWQ et GPTQ 0,55). Source : connaissance/faits.yaml, famille quantifications, vérifiée le 2026-08-31.
- Marge d’exécution × 1,15 : hypothèse d’exploitation QDNA, non mesurée : 15 % au-dessus des poids pour les activations, les tampons et la fragmentation.
- Seuil « tient » à 75 % de la mémoire : hypothèse QDNA, non mesurée, qui réserve le quart restant au cache d’attention et à la concurrence.