Config PC pour l'IA locale : LLM et génération d'images
Faire tourner un modèle de langage ou générer des images en local dépend d'un seul chiffre : la VRAM. Un modèle qui ne tient pas en mémoire ne tourne tout simplement pas. Voici comment dimensionner une machine pour l'IA, sans payer ce qui ne sert pas.
Résumé de la configuration
La VRAM avant tout le reste
Pour l’IA locale, la hiérarchie des priorités est simple et brutale :
VRAM > bande passante mémoire > puissance de calcul > CPU > RAM système
Un modèle qui ne tient pas en VRAM doit déborder sur la RAM système via le bus PCIe. Le résultat n’est pas une dégradation progressive : la vitesse de génération chute d’un facteur 10 à 30.
VRAM nécessaire par usage
Modèles de langage (LLM)
| Taille du modèle | Précision | VRAM nécessaire |
|---|---|---|
| 7–8 B | 4 bits (Q4) | 6–8 Go |
| 7–8 B | 8 bits (Q8) | 10–12 Go |
| 13–14 B | 4 bits | 10–12 Go |
| 30–32 B | 4 bits | 20–24 Go |
| 70 B | 4 bits | 40–48 Go |
| 70 B | 8 bits | 75–80 Go |
À ces valeurs s’ajoute le contexte : une fenêtre de 32 000 tokens consomme 2 à 6 Go supplémentaires selon l’architecture du modèle.
Génération d’images et de vidéo
| Usage | VRAM |
|---|---|
| Modèles de diffusion standard | 6–8 Go |
| Haute résolution / upscaling | 12–16 Go |
| Entraînement LoRA | 16–24 Go |
| Génération vidéo | 24 Go+ |
| Fine-tuning complet | 40 Go+ |
Trois configurations selon le budget
Entrée — ~1250 € : modèles 7–14 B et images
| Composant | Modèle | Prix |
|---|---|---|
| CPU | Ryzen 5 9600X | 200 € |
| GPU | RTX 5060 Ti 16 Go | 450 € |
| Carte mère | B650M Gaming Plus WiFi | 145 € |
| RAM | 32 Go DDR5-6000 CL30 | 110 € |
| SSD | 2 To NVMe | 130 € |
| PSU | 650 W Gold ATX 3.1 | 95 € |
| Boîtier | Fractal Pop Air | 80 € |
| Refroidissement | Peerless Assassin | 40 € |
| Total | ~1250 € |
Seize gigaoctets de VRAM permettent : LLM 14 B en 4 bits, génération d’images haute résolution, entraînement LoRA léger.
Intermédiaire — ~2000 € : modèles 32 B
| Composant | Modèle | Prix |
|---|---|---|
| CPU | Ryzen 7 9700X | 290 € |
| GPU | RTX 5080 16 Go | 1150 € |
| Carte mère | ASUS TUF B850-Plus WiFi | 215 € |
| RAM | 64 Go DDR5-6000 CL30 | 195 € |
| SSD | 2 To NVMe | 130 € |
| PSU | 850 W Gold ATX 3.1 | 160 € |
| Boîtier | Lian Li Lancool 216 | 110 € |
| Refroidissement | Peerless Assassin | 40 € |
| Total | ~2290 € |
La RTX 5080 offre la même VRAM que la 5060 Ti mais une bande passante de 960 Go/s contre 448 — soit une vitesse de génération environ 2 fois supérieure.
Sans limite — ~3480 € : modèles 70 B
C’est la configuration détaillée ci-dessous, avec RTX 5090 et ses 32 Go.
Carte graphique : le choix structurant
| GPU | VRAM | Bande passante | Modèle max (Q4) |
|---|---|---|---|
| RTX 5060 Ti 16 Go | 16 Go | 448 Go/s | 14 B confortable |
| RX 9070 XT | 16 Go | 640 Go/s | 14 B |
| RTX 5070 Ti | 16 Go | 896 Go/s | 14 B rapide |
| RTX 5080 | 16 Go | 960 Go/s | 14 B très rapide |
| RTX 5090 | 32 Go | 1792 Go/s | 32 B confortable |
Pourquoi Nvidia domine ce domaine
L’écosystème CUDA est le facteur décisif. La quasi-totalité des frameworks (PyTorch, TensorFlow, llama.cpp, ComfyUI, vLLM) sont développés et optimisés d’abord pour CUDA.
ROCm, l’équivalent AMD, a beaucoup progressé mais reste en retrait sur le support, la compatibilité des bibliothèques et la documentation. Pour du jeu, AMD est excellent ; pour de l’IA, Nvidia reste le choix pragmatique.
La bande passante détermine la vitesse
À VRAM égale, c’est la bande passante mémoire qui fixe la vitesse de génération de tokens : un LLM lit l’intégralité de ses poids à chaque token généré.
Ordre de grandeur pour un modèle 14 B en Q4 :
| GPU | Tokens/seconde |
|---|---|
| RTX 5060 Ti | ~28 |
| RTX 5070 Ti | ~55 |
| RTX 5080 | ~60 |
| RTX 5090 | ~110 |
Processeur : moins critique qu’on ne croit
Pour l’inférence sur GPU, le CPU ne fait que préparer les données. Un Ryzen 5 suffit dans la majorité des cas.
Le CPU devient important dans trois situations :
- Inférence CPU ou hybride (modèle plus grand que la VRAM, avec offload partiel en RAM) — là, le nombre de cœurs et la bande passante mémoire comptent directement.
- Préparation de datasets, tokenisation, traitement de gros corpus.
- Serveur d’inférence multi-utilisateurs.
Pour la configuration haut de gamme, un Ryzen 9 9950X (16 cœurs) est pertinent si tu fais de l’offload CPU ou du prétraitement lourd. Sinon, économise et prends un Ryzen 7.
RAM système : la règle du double
La règle pratique est d’avoir au moins deux fois la VRAM en RAM système :
| VRAM GPU | RAM conseillée |
|---|---|
| 12–16 Go | 32 Go |
| 24 Go | 64 Go |
| 32 Go | 64–96 Go |
| Offload CPU fréquent | 128 Go |
La RAM sert au chargement initial des modèles (un fichier de 40 Go transite par la RAM), à l’offload partiel, et au prétraitement.
Toujours deux barrettes, jamais quatre : quatre barrettes forcent le contrôleur mémoire à baisser la fréquence de 800 à 1200 MHz.
Stockage : les modèles sont volumineux
| Contenu | Taille typique |
|---|---|
| LLM 7 B (Q4) | 4–5 Go |
| LLM 14 B (Q4) | 8–9 Go |
| LLM 32 B (Q4) | 18–20 Go |
| LLM 70 B (Q4) | 40–45 Go |
| Modèle de diffusion | 2–7 Go |
| Collection de LoRA | 5–50 Go |
Une collection de modèles atteint vite plusieurs téraoctets. Prévois 4 To minimum si tu expérimentes sérieusement.
Le débit séquentiel accélère le chargement initial du modèle en VRAM (quelques secondes gagnées), mais n’a aucun effet sur la vitesse d’inférence une fois le modèle chargé. Un bon PCIe 4.0 suffit.
Alimentation et refroidissement
Une RTX 5090 consomme 575 W en charge — et l’inférence IA est une charge soutenue, pas intermittente comme le jeu. Le comportement thermique est donc plus proche d’un rendu 3D que d’une session de gaming.
Calcul : 575 W + 230 W (Ryzen 9) + 100 W = 905 W, × 1,3 = 1177 W → 1200 W ATX 3.1.
Côté boîtier, privilégie un mesh très ventilé. Une session d’inférence de plusieurs heures maintient le GPU à sa consommation maximale en continu.
Multi-GPU : à quelles conditions ?
Empiler deux GPU permet d’additionner la VRAM (deux RTX 5090 = 64 Go) et de charger des modèles 70 B en 8 bits.
Contraintes à connaître :
- Une carte mère avec deux slots PCIe ×16 fonctionnant en ×8/×8 (X870E, TRX50).
- Une alimentation de 1600 W minimum pour deux RTX 5090.
- Un boîtier capable d’évacuer 1150 W de chaleur.
- Un espacement suffisant : les cartes tri-slot se touchent souvent.
- Un logiciel qui gère la répartition (vLLM, llama.cpp avec
--split-mode, Accelerate).
Pour la majorité des usages personnels, une seule carte à forte VRAM est plus simple et plus efficace.
Logiciels à installer
| Outil | Usage |
|---|---|
| Ollama | LLM en local, installation la plus simple |
| LM Studio | Interface graphique pour LLM |
| llama.cpp | Inférence optimisée, quantification |
| ComfyUI | Génération d’images, workflow nodal |
| text-generation-webui | Interface complète pour LLM |
| PyTorch + CUDA Toolkit | Développement et fine-tuning |
Questions fréquentes
Peut-on faire de l’IA locale avec 8 Go de VRAM ? Oui, pour des modèles 7 B en 4 bits et de la génération d’images standard. Au-delà, ça devient rapidement contraignant.
AMD ou Nvidia pour l’IA ? Nvidia, sans hésiter, à cause de CUDA. ROCm progresse mais reste en retrait sur le support logiciel et la compatibilité des bibliothèques.
Une RTX 5090 vaut-elle vraiment le double d’une 5080 ? Pour du jeu, non. Pour l’IA, ses 32 Go et sa bande passante de 1792 Go/s la rendent irremplaçable — elle permet de faire tourner des modèles qu’aucune autre carte grand public ne peut charger.
Faut-il un CPU à 16 cœurs ? Seulement si tu fais de l’offload CPU ou du prétraitement de datasets. Pour de l’inférence GPU pure, un Ryzen 5 suffit.
La quantification dégrade-t-elle beaucoup la qualité ? En 4 bits (Q4_K_M), la perte est faible et généralement acceptable. En dessous (Q3, Q2), la dégradation devient nettement perceptible. Le Q4 est le point d’équilibre standard.
⚠️ Liens affiliés Amazon : Les liens de cette page sont des liens d'affiliation. Nous recevons une petite commission sur les achats effectués via ces liens, sans coût supplémentaire pour vous.