QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

Secteurs : LLM local et conformité

Le cadre réglementaire varie selon le secteur, la question du transfert de données ne varie pas.

Réponse courte. Un modèle servi sur site traite les données sur place. Aucune donnée ne sort du système d’information, ce qui retire la question du transfert vers un tiers.

Par secteur

Ce que ces pages ne disent pas

Elles décrivent une architecture et ne constituent pas un avis juridique. La conformité s’apprécie sur le traitement réel, avec le délégué à la protection des données de l’organisation.

Méthode et sources

Les empreintes sont calculées : milliards de paramètres × octets par paramètre du format × 1,15 de marge d’exécution. Elles ne sont pas mesurées sur machine. Le cache d’attention s’ajoute et dépend du contexte et de la concurrence. Les prix sont indicatifs et non contractuels. Chaque page de détail porte ses sources ; les conventions communes sont celles-ci.

  • Octets par paramètre : FP16 2 (16 bits par paramètre, soit 2 octets) ; FP8 1 (8 bits par paramètre (E4M3), soit 1 octet, échelles par bloc non comptées) ; NVFP4 0,5 (4 bits par paramètre, soit 0,5 octet ; les poids publiés en 4 bits pèsent 0,54 à 0,56 octet par paramètre avec leurs échelles (DeepSeek V4 Pro 865 Go pour 1 599 milliards, Kimi K3 1 561 Go pour 2 780 milliards)) ; Q4 0,6 (entendu ici comme Q4_K_M de llama.cpp, 0,6 octet par paramètre échelles comprises ; Q4_K_S pèse 0,56, AWQ et GPTQ 0,55). Source : connaissance/faits.yaml, famille quantifications, vérifiée le 2026-08-31.
  • Marge d’exécution × 1,15 : hypothèse d’exploitation QDNA, non mesurée : 15 % au-dessus des poids pour les activations, les tampons et la fragmentation.
  • Seuil « tient » à 75 % de la mémoire : hypothèse QDNA, non mesurée, qui réserve le quart restant au cache d’attention et à la concurrence.