Skip to main content
PromptQuorumPromptQuorum
Accueil/LLMs locaux/Configuration PC pour LLM local à moins de $1,000 (2026) : liste de pièces complète et performances
Hardware Setups

Configuration PC pour LLM local à moins de $1,000 (2026) : liste de pièces complète et performances

·9 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

Une configuration PC pour LLM local à $1,000 repose sur un seul composant : un GPU avec 16 Go de VRAM. La RTX 5060 Ti 16 Go ($430) associée à un Ryzen 5 7600 ($180), 32 Go de DDR5-6000 ($90), un SSD NVMe Gen4 1 To ($70), une carte mère B650 mATX ($130), une alimentation 650W 80+ Gold ($75) et un boîtier mATX ($65) totalise environ $1,010. Elle fait tourner les modèles 7B à 55-65 tok/s, les modèles 14B à 28-35 tok/s et les modèles 32B à un rythme serré mais utilisable de 12-15 tok/s, le tout en quantification Q4.

Un PC à $1,000 avec une RTX 5060 Ti 16 Go, un Ryzen 5 7600 et 32 Go de RAM DDR5 fait tourner confortablement tous les modèles 7B-14B en Q4 et loge les modèles 32B avec une quantification Q4 serrée. La VRAM est le seul facteur limitant pour l'inférence LLM locale, donc cette configuration consacre près de la moitié de son budget ($430 sur $1,000) au GPU plutôt que de répartir les fonds également entre les composants. Ce guide détaille les composants exacts, pourquoi chacun a été choisi plutôt que les alternatives, et les vitesses en tokens par seconde à attendre sur des modèles réels.

Points clés

  • Coût total de la configuration : ~$1,010. RTX 5060 Ti 16 Go ($430), Ryzen 5 7600 ($180), 32 Go DDR5-6000 ($90), NVMe Gen4 1 To ($70), carte mère B650 mATX ($130), alimentation 650W 80+ Gold ($75), boîtier mATX ($65).
  • 16 Go de VRAM est l'objectif, pas la vitesse brute du GPU. La RTX 5060 Ti 16 Go surpasse des cartes plus rapides à 8-12 Go de VRAM pour le travail LLM, car c'est la taille du modèle, pas le nombre de shaders, qui décide de ce qui tient ou non.
  • Modèles 7B : 55-65 tok/s en Q4. Modèles 14B : 28-35 tok/s. Les modèles 32B tiennent en Q4 avec 1-2 Go de marge pour le contexte, à 12-15 tok/s.
  • Les modèles 70B ne tiennent pas. Un modèle 70B en Q4 nécessite environ 40 Go de VRAM ; cette configuration plafonne autour de 32B. Voir la configuration $2,000 à double GPU pour l'inférence de classe 70B.
  • 32 Go de RAM système, pas 16 Go. Le chargement du modèle, la charge du système d'exploitation et toute couche déchargée sur le CPU nécessitent de la marge au-delà du GPU ; 16 Go provoque du swap sur les modèles 14B et plus.
  • À éviter : les GPU 8 Go (RTX 5060, RTX 4060 Ti 8 Go) — ils plafonnent à 7B et ne peuvent pas évoluer vers 13B-14B sans remplacer entièrement le GPU.

Ce que ce budget achète réellement

La vitesse d'inférence LLM locale est limitée d'abord par la capacité de VRAM, ensuite par la bande passante mémoire, et le calcul (cœurs CUDA) arrive loin derrière en troisième position. Un modèle qui ne tient pas dans la VRAM échoue au chargement ou déborde vers la RAM système, ce qui réduit le débit de 5 à 10 fois. À $1,000, la seule allocation correcte consiste à surpondérer le GPU et sous-pondérer tout le reste — c'est pourquoi le CPU ici est un composant milieu de gamme à $180, et non un modèle haut de gamme à $350.

Cette configuration suppose une inférence à modèle unique (un seul modèle chargé à la fois via Ollama, LM Studio ou llama.cpp), pas un service concurrent multi-utilisateurs. Pour servir plusieurs requêtes simultanées, les besoins en VRAM augmentent encore et un budget de $1,000 n'est pas réaliste.

📍 En une phrase

Une configuration PC pour LLM local à $1,000 doit consacrer près de la moitié de son budget à la capacité de VRAM du GPU, pas à la vitesse du CPU, car c'est la VRAM qui décide quels modèles peuvent tourner.

💬 En termes simples

La VRAM = la mémoire propre du GPU où réside le modèle ; si le modèle n'y tient pas, tout ralentit de 5 à 10 fois ou échoue au chargement.

Liste de pièces complète

Les prix sont des prix courants de juillet 2026 et varient selon la région et le revendeur.

ComposantChoixPrixPourquoi
GPURTX 5060 Ti 16 Go$43016 Go de VRAM est l'objectif principal de cette configuration — loge le 14B confortablement, le 32B en Q4 serré
CPUAMD Ryzen 5 7600$1806 cœurs suffisent pour l'inférence à modèle unique ; le CPU n'est pas le goulot d'étranglement
RAM32 Go DDR5-6000 (2x16 Go)$90Marge pour le système, le chargement du modèle et toute couche déchargée sur le CPU
StockageSSD NVMe Gen4 1 To$70Chargement rapide des modèles ; une bibliothèque de 5 modèles utilise ~40-60 Go en Q4
Carte mèreB650 mATX$130Slot PCIe 4.0 x16, support DDR5, sans fonctionnalités superflues
Alimentation650W 80+ Gold$75La RTX 5060 Ti consomme 180W ; 650W laisse de la marge pour les pics transitoires
BoîtierMid-tower mATX$65Circulation d'air pour une charge d'inférence soutenue ; accueille toute carte 5060 Ti quelle que soit sa longueur
Ventirad CPUVentirad d'origine inclus$0Le Ryzen 5 7600 n'a pas besoin de refroidissement après-vente pour cette charge de travail
Consommation système estimée face à la capacité de l'alimentation : le build à 1 000 $ à une seule GPU consomme env. 285W sur une alimentation 650W (56% de marge) ; le build à 2 000 $ à double GPU consomme env. 475W sur une alimentation 850W (44% de marge).
Consommation système estimée face à la capacité de l'alimentation : le build à 1 000 $ à une seule GPU consomme env. 285W sur une alimentation 650W (56% de marge) ; le build à 2 000 $ à double GPU consomme env. 475W sur une alimentation 850W (44% de marge).

Pourquoi la RTX 5060 Ti 16 Go plutôt que des GPU moins chers

Les variantes 8 Go et 12 Go de GPU à prix similaires sont de fausses économies pour le travail LLM local. La RTX 5060 Ti existe en versions 8 Go et 16 Go avec une différence de prix d'environ $100 — la carte 16 Go est la seule qui vaille la peine d'être achetée pour l'inférence LLM, car la version 8 Go ne peut pas loger confortablement plus qu'un modèle 7B en Q4 avec une longueur de contexte utilisable.

La marge de VRAM compte aussi pour la longueur de contexte : un modèle 7B a lui-même besoin d'environ 4-4.5 Go en Q4, mais un contexte de 16K tokens ajoute encore 1-2 Go de cache KV. Sur une carte 8 Go, il ne reste presque rien ; sur la carte 16 Go, il y a de la place pour le modèle et une longue fenêtre de contexte.

  • RTX 5060 Ti 8 Go ($330) : Loge seulement le 7B en Q4, et de justesse — les longues fenêtres de contexte dépasseront la VRAM. Non recommandé.
  • RTX 4060 Ti 16 Go (génération précédente, ~$450 d'occasion) : Même VRAM que la 5060 Ti à un prix similaire ou supérieur avec un calcul inférieur — aucune raison de la préférer neuve.
  • RTX 5060 Ti 16 Go ($430, cette configuration) : Meilleur rapport VRAM/prix du segment 16 Go en juillet 2026.
  • RTX 3090 24 Go d'occasion (~$650-750) : Plus de VRAM (loge les modèles 30B bas de gamme plus confortablement) mais pousse le coût total au-delà de $1,300 et consomme nettement plus d'énergie.
VRAM nécessaire selon la taille du modèle en quantification Q4 : 7B nécessite env. 5GB, 14B env. 9GB et 32B env. 15GB — tout tient sur la carte 16GB du build à 1 000 $. 70B nécessite env. 40GB, ce qui exige les 32GB de VRAM combinée de la double GPU du build à 2 000 $.
VRAM nécessaire selon la taille du modèle en quantification Q4 : 7B nécessite env. 5GB, 14B env. 9GB et 32B env. 15GB — tout tient sur la carte 16GB du build à 1 000 $. 70B nécessite env. 40GB, ce qui exige les 32GB de VRAM combinée de la double GPU du build à 2 000 $.

Performances attendues par taille de modèle

Tous les chiffres sont en quantification Q4_K_M, mesurés avec llama.cpp/Ollama sur la RTX 5060 Ti 16 Go. La vitesse réelle varie selon la longueur du prompt, la méthode de quantification et le moteur d'inférence.

Taille du modèleVRAM utilisée (Q4)Tokens/sLoge confortablement ?
7B-8B~4.5-5 Go55-65Oui — pleine marge de contexte
13B-14B~8-9 Go28-35Oui — 8 Go+ de marge pour le contexte
20B (MoE, ~4B actifs)~12 Go35-45Oui
32B~14.5-15.5 Go12-15Serré — contexte court uniquement (4K-8K)
70B~40 GoN/ANe tient pas — voir la configuration $2,000 à double GPU
Tokens/s selon la taille du modèle, quantification Q4 : les deux builds sont à égalité en 7B (env. 60 tok/s) et 14B (env. 31 tok/s), mais le build à 2 000 $ à double GPU prend l'avantage en 32B via le tensor-split (env. 34 contre env. 13 tok/s) et est le seul à exécuter le 70B (env. 15 tok/s).
Tokens/s selon la taille du modèle, quantification Q4 : les deux builds sont à égalité en 7B (env. 60 tok/s) et 14B (env. 31 tok/s), mais le build à 2 000 $ à double GPU prend l'avantage en 32B via le tensor-split (env. 34 contre env. 13 tok/s) et est le seul à exécuter le 70B (env. 15 tok/s).

Notes d'assemblage

  • Dégagement GPU : Vérifiez la longueur de la carte RTX 5060 Ti (varie de 210 à 270 mm selon le fabricant) par rapport au dégagement GPU maximal du boîtier mATX avant de commander.
  • Vitesse RAM dans le BIOS : Les kits DDR5-6000 fonctionnent souvent par défaut au JEDEC 4800 — activez EXPO/XMP dans le BIOS pour obtenir la vitesse nominale de 6000, ce qui affecte la génération de tokens côté CPU si des couches sont déchargées.
  • Ordre d'installation des pilotes : Installez le dernier pilote NVIDIA et le toolkit CUDA avant d'installer Ollama ou LM Studio, pas après — les deux détectent automatiquement les capacités du GPU à l'installation.
  • Câblage de l'alimentation : La RTX 5060 Ti utilise un seul connecteur d'alimentation PCIe 8 broches (ou 12VHPWR sur certains modèles) — vérifiez que le kit de câbles modulaires de votre alimentation inclut le bon connecteur avant l'assemblage.

Voie d'évolution

Cette configuration est conçue pour que le GPU soit le seul composant à remplacer plus tard. La carte mère B650 supporte un second slot PCIe (généralement x4 électrique) pour ajouter un second GPU ultérieurement, bien que l'inférence multi-GPU en tensor-split nécessite au moins du x8/x8 pour éviter un goulot d'étranglement de bande passante PCIe — voir la configuration $2,000 pour une carte mère choisie en tenant compte de cela.

Une évolution simple à partir de cette configuration consiste à remplacer la RTX 5060 Ti 16 Go par une RTX 3090 24 Go d'occasion quand le budget le permet, ce qui débloque une inférence 32B confortable et un léger déchargement 70B. Le Ryzen 5 7600, les 32 Go de RAM et l'alimentation 650W ont tous assez de marge pour supporter cette évolution sans autres changements.

Erreurs courantes à ce budget

  • Acheter la RTX 5060 Ti 8 Go pour économiser $100 — le plafond de VRAM ainsi créé ne peut pas être corrigé par logiciel et force un remplacement du GPU plus tard, coûtant plus cher au final.
  • Surinvestir dans le CPU (par exemple un Ryzen 7 au lieu d'un Ryzen 5) tout en utilisant un GPU 8 Go ou 12 Go — le choix du CPU a presque aucun effet sur les tokens/s une fois qu'un modèle tient dans la VRAM.
  • Sauter la configuration du profil RAM EXPO/XMP dans le BIOS, laissant les kits DDR5-6000 tourner à 4800 — une perte de performance gratuite qui ne coûte rien à corriger.
  • Sous-dimensionner l'alimentation pour économiser $20-30 — la consommation du GPU pique brièvement bien au-dessus de son TDP nominal sous charge soutenue, et une unité 550W laisse trop peu de marge.

Questions fréquemment posées

Un PC à $1,000 peut-il faire tourner correctement des LLM locaux ?

Oui, confortablement pour les modèles 7B-14B et pour les modèles 32B avec une quantification Q4 serrée. Une RTX 5060 Ti 16 Go, composant central de cette configuration, est le facteur décisif — la capacité de VRAM compte bien plus que le budget brut au-delà du GPU.

Pourquoi cette configuration dépense-t-elle autant sur le GPU par rapport au CPU ?

La vitesse d'inférence LLM locale dépend presque entièrement de la capacité de VRAM du GPU et de la bande passante mémoire. Un CPU plus rapide n'augmente pas les tokens/s une fois qu'un modèle est chargé en VRAM, donc un CPU milieu de gamme associé à un GPU puissant bat un CPU puissant associé à un GPU faible pour cette charge de travail spécifique.

16 Go de VRAM suffisent-ils pour les LLM locaux en 2026 ?

16 Go loge confortablement tous les modèles 7B-14B en Q4 avec de la place pour un long contexte, et loge les modèles 32B en Q4 avec une fenêtre de contexte courte. Cela ne loge pas les modèles de classe 70B, qui nécessitent environ 40 Go en Q4.

Puis-je utiliser un GPU 8 Go à la place pour économiser de l'argent ?

Vous le pouvez, mais cela vous limite aux modèles 7B avec une marge de contexte minimale — un plafond strict que vous ne pouvez pas relever sans remplacer la carte. Les $100 économisés sur une RTX 5060 Ti 8 Go ne valent pas la perte d'accès aux modèles 13B-14B.

De combien de RAM ai-je réellement besoin en plus d'un GPU à 16 Go de VRAM ?

32 Go de RAM système. Cela couvre la charge du système d'exploitation, la mise en cache des fichiers de modèle pendant le chargement, et toute couche déchargée sur le CPU pour les modèles dépassant légèrement la capacité de VRAM.

Cette configuration fera-t-elle bien tourner les modèles 32B ?

Elle loge les modèles 32B en quantification Q4 à environ 12-15 tokens par seconde, mais la longueur de contexte est limitée à environ 4K-8K tokens car il reste peu de marge de VRAM après le chargement du modèle.

Quel logiciel dois-je utiliser sur cette configuration ?

Ollama ou LM Studio sont les points de départ les plus simples — les deux détectent automatiquement la RTX 5060 Ti et gèrent la quantification Q4 automatiquement. llama.cpp directement offre plus de contrôle sur le format de quantification et les paramètres de contexte.

Cette configuration peut-elle être améliorée pour faire tourner des modèles 70B plus tard ?

Pas avec un seul GPU — le 70B en Q4 nécessite environ 40 Go de VRAM. La voie d'évolution la plus claire est soit de passer à une RTX 3090 24 Go d'occasion (toujours pas tout à fait suffisant pour un 70B complet), soit d'ajouter un second GPU pour la mise en commun de VRAM, ce que la configuration $2,000 à double GPU couvre directement.

Le chipset de la carte mère (B650 vs B850) compte-t-il pour l'inférence LLM locale ?

Pas pour une configuration mono-GPU. Le B650 fournit un slot PCIe 4.0 x16, ce dont le GPU a besoin ; les différences de chipset entre le B650 et les cartes plus récentes comptent davantage pour l'allocation des voies PCIe multi-GPU que pour l'inférence LLM mono-GPU.

Un GPU d'occasion offre-t-il un meilleur rapport qualité-prix qu'une RTX 5060 Ti 16 Go neuve à ce budget ?

Une RTX 3060 12 Go d'occasion peut être moins chère mais a moins de VRAM et une bande passante mémoire inférieure, logeant moins de tailles de modèles. Une RTX 3090 24 Go d'occasion est une réelle amélioration de VRAM mais pousse le coût total au-delà de $1,300 en comptant le reste de la configuration — elle appartient à un palier de budget supérieur, pas à celui-ci.

Note sur les faits tiers

Cet article fait référence à des modèles d’IA, des benchmarks, des prix et des licences de tiers. Le paysage de l’IA évolue rapidement. Les scores de benchmark, les conditions de licence, les noms de modèles et les prix des API peuvent changer entre le moment de la rédaction et le moment où vous lisez ceci. Avant de prendre des décisions de déploiement ou de conformité basées sur cet article, vérifiez les chiffres actuels auprès de la source officielle de chaque fournisseur : fiches de modèles Hugging Face pour les licences et benchmarks, sites web des fournisseurs pour les prix API, et EUR-Lex pour les textes RGPD et AI Act actuels. Cet article reflète les informations publiques disponibles en mai 2026.

Utilisez PromptQuorum avec un LLM local, vos propres clés API, ou les deux — vous choisissez le backend.

Rejoindre la liste d'attente PromptQuorum →

← Retour aux LLMs locaux