🖥️ Station de travail Haut de gamme

Config PC pour l'IA locale : LLM et génération d'images

Faire tourner un modèle de langage ou générer des images en local dépend d'un seul chiffre : la VRAM. Un modèle qui ne tient pas en mémoire ne tourne tout simplement pas. Voici comment dimensionner une machine pour l'IA, sans payer ce qui ne sert pas.

2500 € budget indicatif

Résumé de la configuration

Prix total estimé 3480 €
100% du budget max de référence (2 500 €)
Processeur (CPU) AMD Ryzen 9 9950X Voir le prix →
Carte graphique (GPU) Nvidia GeForce RTX 5090 32 Go Voir le prix →
Carte mère ASUS ProArt X870E-Creator Voir le prix →
RAM 64 Go DDR5-6000 CL30 Voir le prix →
Stockage SSD NVMe 4 To PCIe 4.0 Voir le prix →
Alimentation (PSU) Corsair HX1200i 80+ Platinum ATX 3.1 Voir le prix →
Boîtier Lian Li O11 Dynamic Evo Voir le prix →

La VRAM avant tout le reste

Pour l’IA locale, la hiérarchie des priorités est simple et brutale :

VRAM > bande passante mémoire > puissance de calcul > CPU > RAM système

Un modèle qui ne tient pas en VRAM doit déborder sur la RAM système via le bus PCIe. Le résultat n’est pas une dégradation progressive : la vitesse de génération chute d’un facteur 10 à 30.

VRAM nécessaire par usage

Modèles de langage (LLM)

Taille du modèlePrécisionVRAM nécessaire
7–8 B4 bits (Q4)6–8 Go
7–8 B8 bits (Q8)10–12 Go
13–14 B4 bits10–12 Go
30–32 B4 bits20–24 Go
70 B4 bits40–48 Go
70 B8 bits75–80 Go

À ces valeurs s’ajoute le contexte : une fenêtre de 32 000 tokens consomme 2 à 6 Go supplémentaires selon l’architecture du modèle.

Génération d’images et de vidéo

UsageVRAM
Modèles de diffusion standard6–8 Go
Haute résolution / upscaling12–16 Go
Entraînement LoRA16–24 Go
Génération vidéo24 Go+
Fine-tuning complet40 Go+

Trois configurations selon le budget

Entrée — ~1250 € : modèles 7–14 B et images

ComposantModèlePrix
CPURyzen 5 9600X200 €
GPURTX 5060 Ti 16 Go450 €
Carte mèreB650M Gaming Plus WiFi145 €
RAM32 Go DDR5-6000 CL30110 €
SSD2 To NVMe130 €
PSU650 W Gold ATX 3.195 €
BoîtierFractal Pop Air80 €
RefroidissementPeerless Assassin40 €
Total~1250 €

Seize gigaoctets de VRAM permettent : LLM 14 B en 4 bits, génération d’images haute résolution, entraînement LoRA léger.

Intermédiaire — ~2000 € : modèles 32 B

ComposantModèlePrix
CPURyzen 7 9700X290 €
GPURTX 5080 16 Go1150 €
Carte mèreASUS TUF B850-Plus WiFi215 €
RAM64 Go DDR5-6000 CL30195 €
SSD2 To NVMe130 €
PSU850 W Gold ATX 3.1160 €
BoîtierLian Li Lancool 216110 €
RefroidissementPeerless Assassin40 €
Total~2290 €

La RTX 5080 offre la même VRAM que la 5060 Ti mais une bande passante de 960 Go/s contre 448 — soit une vitesse de génération environ 2 fois supérieure.

Sans limite — ~3480 € : modèles 70 B

C’est la configuration détaillée ci-dessous, avec RTX 5090 et ses 32 Go.

Carte graphique : le choix structurant

GPUVRAMBande passanteModèle max (Q4)
RTX 5060 Ti 16 Go16 Go448 Go/s14 B confortable
RX 9070 XT16 Go640 Go/s14 B
RTX 5070 Ti16 Go896 Go/s14 B rapide
RTX 508016 Go960 Go/s14 B très rapide
RTX 509032 Go1792 Go/s32 B confortable

Pourquoi Nvidia domine ce domaine

L’écosystème CUDA est le facteur décisif. La quasi-totalité des frameworks (PyTorch, TensorFlow, llama.cpp, ComfyUI, vLLM) sont développés et optimisés d’abord pour CUDA.

ROCm, l’équivalent AMD, a beaucoup progressé mais reste en retrait sur le support, la compatibilité des bibliothèques et la documentation. Pour du jeu, AMD est excellent ; pour de l’IA, Nvidia reste le choix pragmatique.

La bande passante détermine la vitesse

À VRAM égale, c’est la bande passante mémoire qui fixe la vitesse de génération de tokens : un LLM lit l’intégralité de ses poids à chaque token généré.

Ordre de grandeur pour un modèle 14 B en Q4 :

GPUTokens/seconde
RTX 5060 Ti~28
RTX 5070 Ti~55
RTX 5080~60
RTX 5090~110

Processeur : moins critique qu’on ne croit

Pour l’inférence sur GPU, le CPU ne fait que préparer les données. Un Ryzen 5 suffit dans la majorité des cas.

Le CPU devient important dans trois situations :

  1. Inférence CPU ou hybride (modèle plus grand que la VRAM, avec offload partiel en RAM) — là, le nombre de cœurs et la bande passante mémoire comptent directement.
  2. Préparation de datasets, tokenisation, traitement de gros corpus.
  3. Serveur d’inférence multi-utilisateurs.

Pour la configuration haut de gamme, un Ryzen 9 9950X (16 cœurs) est pertinent si tu fais de l’offload CPU ou du prétraitement lourd. Sinon, économise et prends un Ryzen 7.

RAM système : la règle du double

La règle pratique est d’avoir au moins deux fois la VRAM en RAM système :

VRAM GPURAM conseillée
12–16 Go32 Go
24 Go64 Go
32 Go64–96 Go
Offload CPU fréquent128 Go

La RAM sert au chargement initial des modèles (un fichier de 40 Go transite par la RAM), à l’offload partiel, et au prétraitement.

Toujours deux barrettes, jamais quatre : quatre barrettes forcent le contrôleur mémoire à baisser la fréquence de 800 à 1200 MHz.

Stockage : les modèles sont volumineux

ContenuTaille typique
LLM 7 B (Q4)4–5 Go
LLM 14 B (Q4)8–9 Go
LLM 32 B (Q4)18–20 Go
LLM 70 B (Q4)40–45 Go
Modèle de diffusion2–7 Go
Collection de LoRA5–50 Go

Une collection de modèles atteint vite plusieurs téraoctets. Prévois 4 To minimum si tu expérimentes sérieusement.

Le débit séquentiel accélère le chargement initial du modèle en VRAM (quelques secondes gagnées), mais n’a aucun effet sur la vitesse d’inférence une fois le modèle chargé. Un bon PCIe 4.0 suffit.

Alimentation et refroidissement

Une RTX 5090 consomme 575 W en charge — et l’inférence IA est une charge soutenue, pas intermittente comme le jeu. Le comportement thermique est donc plus proche d’un rendu 3D que d’une session de gaming.

Calcul : 575 W + 230 W (Ryzen 9) + 100 W = 905 W, × 1,3 = 1177 W → 1200 W ATX 3.1.

Côté boîtier, privilégie un mesh très ventilé. Une session d’inférence de plusieurs heures maintient le GPU à sa consommation maximale en continu.

Multi-GPU : à quelles conditions ?

Empiler deux GPU permet d’additionner la VRAM (deux RTX 5090 = 64 Go) et de charger des modèles 70 B en 8 bits.

Contraintes à connaître :

  • Une carte mère avec deux slots PCIe ×16 fonctionnant en ×8/×8 (X870E, TRX50).
  • Une alimentation de 1600 W minimum pour deux RTX 5090.
  • Un boîtier capable d’évacuer 1150 W de chaleur.
  • Un espacement suffisant : les cartes tri-slot se touchent souvent.
  • Un logiciel qui gère la répartition (vLLM, llama.cpp avec --split-mode, Accelerate).

Pour la majorité des usages personnels, une seule carte à forte VRAM est plus simple et plus efficace.

Logiciels à installer

OutilUsage
OllamaLLM en local, installation la plus simple
LM StudioInterface graphique pour LLM
llama.cppInférence optimisée, quantification
ComfyUIGénération d’images, workflow nodal
text-generation-webuiInterface complète pour LLM
PyTorch + CUDA ToolkitDéveloppement et fine-tuning

Questions fréquentes

Peut-on faire de l’IA locale avec 8 Go de VRAM ? Oui, pour des modèles 7 B en 4 bits et de la génération d’images standard. Au-delà, ça devient rapidement contraignant.

AMD ou Nvidia pour l’IA ? Nvidia, sans hésiter, à cause de CUDA. ROCm progresse mais reste en retrait sur le support logiciel et la compatibilité des bibliothèques.

Une RTX 5090 vaut-elle vraiment le double d’une 5080 ? Pour du jeu, non. Pour l’IA, ses 32 Go et sa bande passante de 1792 Go/s la rendent irremplaçable — elle permet de faire tourner des modèles qu’aucune autre carte grand public ne peut charger.

Faut-il un CPU à 16 cœurs ? Seulement si tu fais de l’offload CPU ou du prétraitement de datasets. Pour de l’inférence GPU pure, un Ryzen 5 suffit.

La quantification dégrade-t-elle beaucoup la qualité ? En 4 bits (Q4_K_M), la perte est faible et généralement acceptable. En dessous (Q3, Q2), la dégradation devient nettement perceptible. Le Q4 est le point d’équilibre standard.

⚠️ Liens affiliés Amazon : Les liens de cette page sont des liens d'affiliation. Nous recevons une petite commission sur les achats effectués via ces liens, sans coût supplémentaire pour vous.