Points clés
- Coût total de la configuration : ~$1,010. RTX 5060 Ti 16 Go ($430), Ryzen 5 7600 ($180), 32 Go DDR5-6000 ($90), NVMe Gen4 1 To ($70), carte mère B650 mATX ($130), alimentation 650W 80+ Gold ($75), boîtier mATX ($65).
- 16 Go de VRAM est l'objectif, pas la vitesse brute du GPU. La RTX 5060 Ti 16 Go surpasse des cartes plus rapides à 8-12 Go de VRAM pour le travail LLM, car c'est la taille du modèle, pas le nombre de shaders, qui décide de ce qui tient ou non.
- Modèles 7B : 55-65 tok/s en Q4. Modèles 14B : 28-35 tok/s. Les modèles 32B tiennent en Q4 avec 1-2 Go de marge pour le contexte, à 12-15 tok/s.
- Les modèles 70B ne tiennent pas. Un modèle 70B en Q4 nécessite environ 40 Go de VRAM ; cette configuration plafonne autour de 32B. Voir la configuration $2,000 à double GPU pour l'inférence de classe 70B.
- 32 Go de RAM système, pas 16 Go. Le chargement du modèle, la charge du système d'exploitation et toute couche déchargée sur le CPU nécessitent de la marge au-delà du GPU ; 16 Go provoque du swap sur les modèles 14B et plus.
- À éviter : les GPU 8 Go (RTX 5060, RTX 4060 Ti 8 Go) — ils plafonnent à 7B et ne peuvent pas évoluer vers 13B-14B sans remplacer entièrement le GPU.
Ce que ce budget achète réellement
La vitesse d'inférence LLM locale est limitée d'abord par la capacité de VRAM, ensuite par la bande passante mémoire, et le calcul (cœurs CUDA) arrive loin derrière en troisième position. Un modèle qui ne tient pas dans la VRAM échoue au chargement ou déborde vers la RAM système, ce qui réduit le débit de 5 à 10 fois. À $1,000, la seule allocation correcte consiste à surpondérer le GPU et sous-pondérer tout le reste — c'est pourquoi le CPU ici est un composant milieu de gamme à $180, et non un modèle haut de gamme à $350.
Cette configuration suppose une inférence à modèle unique (un seul modèle chargé à la fois via Ollama, LM Studio ou llama.cpp), pas un service concurrent multi-utilisateurs. Pour servir plusieurs requêtes simultanées, les besoins en VRAM augmentent encore et un budget de $1,000 n'est pas réaliste.
📍 En une phrase
Une configuration PC pour LLM local à $1,000 doit consacrer près de la moitié de son budget à la capacité de VRAM du GPU, pas à la vitesse du CPU, car c'est la VRAM qui décide quels modèles peuvent tourner.
💬 En termes simples
La VRAM = la mémoire propre du GPU où réside le modèle ; si le modèle n'y tient pas, tout ralentit de 5 à 10 fois ou échoue au chargement.
Liste de pièces complète
Les prix sont des prix courants de juillet 2026 et varient selon la région et le revendeur.
| Composant | Choix | Prix | Pourquoi |
|---|---|---|---|
| GPU | RTX 5060 Ti 16 Go | $430 | 16 Go de VRAM est l'objectif principal de cette configuration — loge le 14B confortablement, le 32B en Q4 serré |
| CPU | AMD Ryzen 5 7600 | $180 | 6 cœurs suffisent pour l'inférence à modèle unique ; le CPU n'est pas le goulot d'étranglement |
| RAM | 32 Go DDR5-6000 (2x16 Go) | $90 | Marge pour le système, le chargement du modèle et toute couche déchargée sur le CPU |
| Stockage | SSD NVMe Gen4 1 To | $70 | Chargement rapide des modèles ; une bibliothèque de 5 modèles utilise ~40-60 Go en Q4 |
| Carte mère | B650 mATX | $130 | Slot PCIe 4.0 x16, support DDR5, sans fonctionnalités superflues |
| Alimentation | 650W 80+ Gold | $75 | La RTX 5060 Ti consomme 180W ; 650W laisse de la marge pour les pics transitoires |
| Boîtier | Mid-tower mATX | $65 | Circulation d'air pour une charge d'inférence soutenue ; accueille toute carte 5060 Ti quelle que soit sa longueur |
| Ventirad CPU | Ventirad d'origine inclus | $0 | Le Ryzen 5 7600 n'a pas besoin de refroidissement après-vente pour cette charge de travail |
Pourquoi la RTX 5060 Ti 16 Go plutôt que des GPU moins chers
Les variantes 8 Go et 12 Go de GPU à prix similaires sont de fausses économies pour le travail LLM local. La RTX 5060 Ti existe en versions 8 Go et 16 Go avec une différence de prix d'environ $100 — la carte 16 Go est la seule qui vaille la peine d'être achetée pour l'inférence LLM, car la version 8 Go ne peut pas loger confortablement plus qu'un modèle 7B en Q4 avec une longueur de contexte utilisable.
La marge de VRAM compte aussi pour la longueur de contexte : un modèle 7B a lui-même besoin d'environ 4-4.5 Go en Q4, mais un contexte de 16K tokens ajoute encore 1-2 Go de cache KV. Sur une carte 8 Go, il ne reste presque rien ; sur la carte 16 Go, il y a de la place pour le modèle et une longue fenêtre de contexte.
- RTX 5060 Ti 8 Go ($330) : Loge seulement le 7B en Q4, et de justesse — les longues fenêtres de contexte dépasseront la VRAM. Non recommandé.
- RTX 4060 Ti 16 Go (génération précédente, ~$450 d'occasion) : Même VRAM que la 5060 Ti à un prix similaire ou supérieur avec un calcul inférieur — aucune raison de la préférer neuve.
- RTX 5060 Ti 16 Go ($430, cette configuration) : Meilleur rapport VRAM/prix du segment 16 Go en juillet 2026.
- RTX 3090 24 Go d'occasion (~$650-750) : Plus de VRAM (loge les modèles 30B bas de gamme plus confortablement) mais pousse le coût total au-delà de $1,300 et consomme nettement plus d'énergie.
Performances attendues par taille de modèle
Tous les chiffres sont en quantification Q4_K_M, mesurés avec llama.cpp/Ollama sur la RTX 5060 Ti 16 Go. La vitesse réelle varie selon la longueur du prompt, la méthode de quantification et le moteur d'inférence.
| Taille du modèle | VRAM utilisée (Q4) | Tokens/s | Loge confortablement ? |
|---|---|---|---|
| 7B-8B | ~4.5-5 Go | 55-65 | Oui — pleine marge de contexte |
| 13B-14B | ~8-9 Go | 28-35 | Oui — 8 Go+ de marge pour le contexte |
| 20B (MoE, ~4B actifs) | ~12 Go | 35-45 | Oui |
| 32B | ~14.5-15.5 Go | 12-15 | Serré — contexte court uniquement (4K-8K) |
| 70B | ~40 Go | N/A | Ne tient pas — voir la configuration $2,000 à double GPU |
Notes d'assemblage
- Dégagement GPU : Vérifiez la longueur de la carte RTX 5060 Ti (varie de 210 à 270 mm selon le fabricant) par rapport au dégagement GPU maximal du boîtier mATX avant de commander.
- Vitesse RAM dans le BIOS : Les kits DDR5-6000 fonctionnent souvent par défaut au JEDEC 4800 — activez EXPO/XMP dans le BIOS pour obtenir la vitesse nominale de 6000, ce qui affecte la génération de tokens côté CPU si des couches sont déchargées.
- Ordre d'installation des pilotes : Installez le dernier pilote NVIDIA et le toolkit CUDA avant d'installer Ollama ou LM Studio, pas après — les deux détectent automatiquement les capacités du GPU à l'installation.
- Câblage de l'alimentation : La RTX 5060 Ti utilise un seul connecteur d'alimentation PCIe 8 broches (ou 12VHPWR sur certains modèles) — vérifiez que le kit de câbles modulaires de votre alimentation inclut le bon connecteur avant l'assemblage.
Voie d'évolution
Cette configuration est conçue pour que le GPU soit le seul composant à remplacer plus tard. La carte mère B650 supporte un second slot PCIe (généralement x4 électrique) pour ajouter un second GPU ultérieurement, bien que l'inférence multi-GPU en tensor-split nécessite au moins du x8/x8 pour éviter un goulot d'étranglement de bande passante PCIe — voir la configuration $2,000 pour une carte mère choisie en tenant compte de cela.
Une évolution simple à partir de cette configuration consiste à remplacer la RTX 5060 Ti 16 Go par une RTX 3090 24 Go d'occasion quand le budget le permet, ce qui débloque une inférence 32B confortable et un léger déchargement 70B. Le Ryzen 5 7600, les 32 Go de RAM et l'alimentation 650W ont tous assez de marge pour supporter cette évolution sans autres changements.
Erreurs courantes à ce budget
- Acheter la RTX 5060 Ti 8 Go pour économiser $100 — le plafond de VRAM ainsi créé ne peut pas être corrigé par logiciel et force un remplacement du GPU plus tard, coûtant plus cher au final.
- Surinvestir dans le CPU (par exemple un Ryzen 7 au lieu d'un Ryzen 5) tout en utilisant un GPU 8 Go ou 12 Go — le choix du CPU a presque aucun effet sur les tokens/s une fois qu'un modèle tient dans la VRAM.
- Sauter la configuration du profil RAM EXPO/XMP dans le BIOS, laissant les kits DDR5-6000 tourner à 4800 — une perte de performance gratuite qui ne coûte rien à corriger.
- Sous-dimensionner l'alimentation pour économiser $20-30 — la consommation du GPU pique brièvement bien au-dessus de son TDP nominal sous charge soutenue, et une unité 550W laisse trop peu de marge.
Questions fréquemment posées
Un PC à $1,000 peut-il faire tourner correctement des LLM locaux ?
Oui, confortablement pour les modèles 7B-14B et pour les modèles 32B avec une quantification Q4 serrée. Une RTX 5060 Ti 16 Go, composant central de cette configuration, est le facteur décisif — la capacité de VRAM compte bien plus que le budget brut au-delà du GPU.
Pourquoi cette configuration dépense-t-elle autant sur le GPU par rapport au CPU ?
La vitesse d'inférence LLM locale dépend presque entièrement de la capacité de VRAM du GPU et de la bande passante mémoire. Un CPU plus rapide n'augmente pas les tokens/s une fois qu'un modèle est chargé en VRAM, donc un CPU milieu de gamme associé à un GPU puissant bat un CPU puissant associé à un GPU faible pour cette charge de travail spécifique.
16 Go de VRAM suffisent-ils pour les LLM locaux en 2026 ?
16 Go loge confortablement tous les modèles 7B-14B en Q4 avec de la place pour un long contexte, et loge les modèles 32B en Q4 avec une fenêtre de contexte courte. Cela ne loge pas les modèles de classe 70B, qui nécessitent environ 40 Go en Q4.
Puis-je utiliser un GPU 8 Go à la place pour économiser de l'argent ?
Vous le pouvez, mais cela vous limite aux modèles 7B avec une marge de contexte minimale — un plafond strict que vous ne pouvez pas relever sans remplacer la carte. Les $100 économisés sur une RTX 5060 Ti 8 Go ne valent pas la perte d'accès aux modèles 13B-14B.
De combien de RAM ai-je réellement besoin en plus d'un GPU à 16 Go de VRAM ?
32 Go de RAM système. Cela couvre la charge du système d'exploitation, la mise en cache des fichiers de modèle pendant le chargement, et toute couche déchargée sur le CPU pour les modèles dépassant légèrement la capacité de VRAM.
Cette configuration fera-t-elle bien tourner les modèles 32B ?
Elle loge les modèles 32B en quantification Q4 à environ 12-15 tokens par seconde, mais la longueur de contexte est limitée à environ 4K-8K tokens car il reste peu de marge de VRAM après le chargement du modèle.
Quel logiciel dois-je utiliser sur cette configuration ?
Ollama ou LM Studio sont les points de départ les plus simples — les deux détectent automatiquement la RTX 5060 Ti et gèrent la quantification Q4 automatiquement. llama.cpp directement offre plus de contrôle sur le format de quantification et les paramètres de contexte.
Cette configuration peut-elle être améliorée pour faire tourner des modèles 70B plus tard ?
Pas avec un seul GPU — le 70B en Q4 nécessite environ 40 Go de VRAM. La voie d'évolution la plus claire est soit de passer à une RTX 3090 24 Go d'occasion (toujours pas tout à fait suffisant pour un 70B complet), soit d'ajouter un second GPU pour la mise en commun de VRAM, ce que la configuration $2,000 à double GPU couvre directement.
Le chipset de la carte mère (B650 vs B850) compte-t-il pour l'inférence LLM locale ?
Pas pour une configuration mono-GPU. Le B650 fournit un slot PCIe 4.0 x16, ce dont le GPU a besoin ; les différences de chipset entre le B650 et les cartes plus récentes comptent davantage pour l'allocation des voies PCIe multi-GPU que pour l'inférence LLM mono-GPU.
Un GPU d'occasion offre-t-il un meilleur rapport qualité-prix qu'une RTX 5060 Ti 16 Go neuve à ce budget ?
Une RTX 3060 12 Go d'occasion peut être moins chère mais a moins de VRAM et une bande passante mémoire inférieure, logeant moins de tailles de modèles. Une RTX 3090 24 Go d'occasion est une réelle amélioration de VRAM mais pousse le coût total au-delà de $1,300 en comptant le reste de la configuration — elle appartient à un palier de budget supérieur, pas à celui-ci.