Faire tourner une IA en local sur votre PC (2026)
Une IA peut tourner sur votre propre machine, sans envoyer vos données au cloud, et de votre PC actuel au mini-supercalculateur DGX Spark, voici les options en 2026.
Mis à jour le 2 septembre 2026 : capacités du cluster alignées sur la page produit NVIDIA (jusqu'à 700 milliards de paramètres sur quatre machines ; la mention « Llama 405B sur deux machines » n'y figure plus), limites de NVIDIA Sync (trois machines en direct, quatre via commutateur), prix relevés chez les marchands avec date (ASUS Ascent GX10, Framework Desktop, Corsair), HP ZGX Nano ajouté au tableau.

Pourquoi faire tourner une IA en local sur son PC ?
Faire tourner un modèle sur votre poste garde vos données chez vous, fonctionne hors ligne et supprime tout abonnement, tout en restant la meilleure façon d'apprendre. En 2026, la stack est mature : les modèles ouverts rivalisent avec les API, et le matériel a fait un bond.
Pour un déploiement d'entreprise, la suite se trouve dans notre guide installer un LLM local.
Option gratuite : votre PC actuel
Sur une machine existante, un logiciel gratuit suffit à démarrer. Ollama et LM Studio offrent une prise en main simple sur Windows, Mac et Linux ; llama.cpp reste la référence légère, qui combine processeur et carte graphique avec une quantification de Q4 à Q8.
Le facteur limitant est la mémoire, car un modèle compact comme Qwen 3.6 ou Gemma 4, de deux à trente-cinq milliards de paramètres (Gemma 4 E2B à 31B, Qwen3.6-27B et Qwen3.6-35B-A3B sur Hugging Face), tourne sur un ordinateur récent doté d'une carte graphique correcte, ou sur un Mac à mémoire unifiée. Le détail des modèles figure dans notre comparatif des LLM open source.
Le mini-supercalculateur de bureau : la puce GB10
Pour des modèles plus grands, une catégorie a émergé : le supercalculateur IA de bureau, fondé sur la puce NVIDIA GB10 Grace Blackwell. Elle réunit un processeur Arm à vingt cœurs et un GPU Blackwell sur un même paquet, reliés par NVLink, avec un pool cohérent de 128 Go de mémoire LPDDR5X.
Elle atteint environ mille téraFLOPS en FP4, soit un pétaFLOP avec parcimonie, dans un boîtier de 150 millimètres de côté.
Cette mémoire unifiée de 128 Go permet de servir des modèles jusqu'à deux cents milliards de paramètres sur une machine, et, selon la page produit NVIDIA relevée le 2 septembre 2026, jusqu'à sept cents milliards en reliant quatre unités par ConnectX-7. Le DGX Spark de NVIDIA est la référence de cette famille.
Comment les machines GB10 diffèrent-elles selon les marques ?
Toutes ces machines partagent la même puce GB10, la même mémoire de 128 Go, les mêmes ports et le même système DGX OS, une variante d'Ubuntu, si bien que les différences portent sur le châssis, le refroidissement, le stockage, la gestion à distance, la garantie et le prix, le port réseau ConnectX-7 expliquant une part notable du tarif.
| Machine | Marque | À noter |
|---|---|---|
| DGX Spark | NVIDIA | La référence, 128 Go, DGX OS |
| Ascent GX10 | ASUS | Souvent l'entrée de gamme la moins chère, garantie limitée |
| Pro Max with GB10 | Dell | Finition entreprise, support et garantie inclus |
| AI TOP ATOM | Gigabyte | Variante châssis et refroidissement |
| ThinkStation PGX | Lenovo | Intégration poste de travail |
| EdgeXpert MS-C931 | MSI | Format compact |
| Veriton GN100 | Acer | Design de bureau |
| ZGX Nano G1n | HP | Station IA compacte, gamme professionnelle |
Les prix ont monté avec la pénurie de mémoire, et les prix relevés le 2 septembre 2026 vont de 4 499,95 € TTC (ASUS Ascent GX10, 1 To, LDLC, en rupture) à 7 511 € TTC (DGX Spark Founders Edition, offre la plus chère sur idealo.fr) selon le stockage et la marque ; le DGX Spark Founders Edition de référence est à 5 850 € TTC (4 875 € HT) au meilleur prix relevé sur idealo.fr le 2 septembre 2026, entre 5 850 et 7 511 € TTC selon le marchand. Le détail par gamme figure dans notre guide des prix d'un serveur IA.
Empiler les DGX Spark pour de plus gros modèles
Chaque machine GB10 porte deux ports réseau ConnectX-7 à l'arrière, à 200 Gb/s, avec RDMA sur Ethernet convergé (RoCE) : les machines s'échangent leurs données de calcul sans passer par le processeur.
NVIDIA documente ce montage sous le nom de Spark Stacking, où deux DGX Spark se relient par un simple câble QSFP direct, sans commutateur, la paire agrégeant 256 Go de mémoire, les poids répartis entre les deux machines par parallélisme tensoriel (deux ports QSFP à 200 Gb/s chacun selon le guide NVIDIA Spark Stacking, relu le 2 septembre 2026).
Trois machines se relient encore en direct en occupant les deux ports de chacune, et un commutateur Ethernet 200 GbE compatible RoCE fédère quatre unités, limite documentée de l'outil NVIDIA Sync : le pool atteint 512 Go et charge des modèles à mélange d'experts qu'aucun poste isolé ne peut tenir. Le montage reste un cluster de bureau, pas une baie : passé quelques unités, la marche suivante est un serveur GPU.
L'attente correcte est la capacité, pas la vitesse, car à chaque passe de calcul, les machines s'échangent les activations sur le lien réseau, et le débit par token baisse par rapport à un modèle qui tient sur une seule machine. L'empilement sert aussi les contextes longs : répartir un modèle de cent vingt milliards de paramètres sur deux machines libère de la mémoire pour le cache de conversation, donc des fenêtres plus longues et plus de sessions simultanées.


Quelle est l'alternative AMD sous Windows ?
Hors de l'écosystème CUDA, la puce AMD Ryzen AI Max+ 395, dite Strix Halo, offre elle aussi 128 Go de mémoire unifiée, à un prix plus bas et sous Windows, le Framework Desktop 128 Go étant affiché 3 889 € (frame.work, relevé le 2 septembre 2026, en rupture) et la Corsair AI Workstation 300 ayant été lancée en Europe à 1 999,99 € en septembre 2025 (communiqué Corsair), tarif que le constructeur a relevé depuis avec la pénurie de mémoire. Ces machines consomment moins au repos, mais l'écosystème logiciel CUDA reste plus fourni côté NVIDIA.
Quel modèle d’IA selon votre machine ?
Le choix précis du modèle se fait dans notre comparatif, et le passage à l'échelle serveur dans le guide d'installation en entreprise.
- PC existant avec carte graphique : un modèle compact quantifié, Qwen 3.6 ou Gemma 4, via Ollama ou llama.cpp.
- Machine GB10 ou Strix Halo, 128 Go : un modèle moyen à grand, jusqu'à deux cents milliards de paramètres quantifiés.
- Deux à quatre machines GB10 reliées : jusqu'à sept cents milliards de paramètres sur quatre, selon NVIDIA.
Questions fréquentes
Comment faire tourner une IA en local sur son PC ?
Installez un logiciel gratuit comme Ollama, LM Studio ou llama.cpp, puis un modèle compact comme Qwen 3.6 ou Gemma 4. L'ensemble tourne sur Windows, Mac ou Linux, sur votre carte graphique et votre processeur.
Peut-on faire tourner une IA en local gratuitement ?
Oui. Les logiciels llama.cpp, Ollama et LM Studio sont gratuits et exécutent un modèle quantifié sur un PC existant. Un modèle compact suffit pour un usage personnel.
Qu'est-ce que le DGX Spark et la puce GB10 ?
Le DGX Spark est un mini-supercalculateur de bureau de NVIDIA fondé sur la puce GB10 Grace Blackwell, avec 128 Go de mémoire unifiée et environ un pétaFLOP en FP4. La même puce équipe des machines d'ASUS, Dell, Gigabyte, HP, Lenovo, MSI et Acer.
Quelle marque de machine GB10 choisir ?
Elles partagent la même puce et les mêmes performances. L'ASUS Ascent GX10 vise le prix le plus bas, le Dell Pro Max mise sur le support et la garantie. Le choix se fait sur le prix, la garantie et l'intégration.
Peut-on relier plusieurs DGX Spark entre eux ?
Oui. Deux machines se relient par un câble QSFP direct à 200 Gb/s en RDMA et agrègent 256 Go. Trois machines se relient encore en direct ; quatre passent par un commutateur Ethernet 200 GbE compatible RoCE, et NVIDIA annonce jusqu'à 700 milliards de paramètres sur quatre machines.
Quelles performances attendre d'une IA en local sur un PC ?
Sur un poste récent, un modèle compact quantifié génère plusieurs dizaines de tokens par seconde, assez pour une conversation fluide. Une machine GB10 comme le DGX Spark sert des modèles bien plus grands, la vitesse dépendant alors de la taille du modèle et du format de quantification, le FP4 offrant le meilleur débit sur les cartes Blackwell.
De votre poste à votre plateforme
Un échange pour choisir la machine, le modèle et le runtime selon votre usage réel.
Réserver un échange