Skip to main content
PromptQuorumPromptQuorum
Accueil/LLMs locaux/Configuration PC pour LLM local à $2,000 (2026) : liste de pièces double GPU 32 Go VRAM
Hardware Setups

Configuration PC pour LLM local à $2,000 (2026) : liste de pièces double GPU 32 Go VRAM

·10 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

Une configuration PC pour LLM local à $2,000 obtient le meilleur rapport VRAM/prix en utilisant deux GPU 16 Go plutôt qu'une seule carte 24 Go. Deux cartes RTX 5060 Ti 16 Go ($430 chacune, $860 au total) offrent 32 Go de VRAM combinée — suffisant pour faire tourner des modèles 70B en Q4 via l'inférence tensor-split — associées à un Ryzen 7 9700X ($330), 64 Go de DDR5-6000 ($180), un SSD NVMe Gen4 2 To ($130), une carte mère B650 ATX avec slots PCIe x8/x8 ($180), une alimentation 850W 80+ Gold ($130) et un boîtier ATX ($90), totalisant environ $1,940. Elle fait tourner les modèles 70B Q4 à 12-18 tok/s répartis sur les deux cartes, ou un seul modèle 32B à 25-30 tok/s sur une carte seule.

Un PC à $2,000 avec deux cartes RTX 5060 Ti 16 Go (32 Go de VRAM combinée), un Ryzen 7 9700X et 64 Go de RAM DDR5 fait tourner des modèles de classe 70B via l'inférence multi-GPU en tensor-split — ce qu'aucun GPU unique à $2,000 ne peut faire. Plutôt que d'acheter une seule carte 24 Go coûteuse, cette configuration met en commun deux cartes 16 Go milieu de gamme via le PCIe grâce au mode tensor-split de llama.cpp, doublant la capacité de VRAM pour moins que le prix d'une seule RTX 5090. Ce guide détaille les composants exacts, l'exigence de carte mère qui fait fonctionner correctement le double GPU, et les vraies vitesses en tokens par seconde.

Points clés

  • Coût total de la configuration : ~$1,940. Deux RTX 5060 Ti 16 Go ($860 au total), Ryzen 7 9700X ($330), 64 Go DDR5-6000 ($180), NVMe Gen4 2 To ($130), carte mère B650 ATX avec slots x8/x8 ($180), alimentation 850W 80+ Gold ($130), boîtier ATX ($90).
  • Deux GPU 16 Go battent un GPU 24 Go sur le rapport VRAM/prix. 32 Go de VRAM combinée pour ~$860 bat une RTX 3090 24 Go d'occasion (~$700-750 pour moins de VRAM au total) et coûte bien moins qu'une seule carte de station de travail 32 Go.
  • Les modèles 70B tiennent et tournent à 12-18 tok/s via le tensor-split de llama.cpp réparti sur les deux cartes — c'est la raison même pour laquelle cette configuration utilise deux GPU plutôt qu'un seul plus gros.
  • La carte mère doit supporter la bifurcation PCIe x8/x8, pas seulement deux slots physiques x16. Une carte qui fait tourner le second slot en x4 électrique crée un véritable goulot d'étranglement de bande passante pour l'inférence tensor-split.
  • Le repli mono-GPU fonctionne toujours bien : pour les modèles plus petits, tourner sur une seule RTX 5060 Ti donne du 32B à 25-30 tok/s — plus rapide que de répartir un modèle qui tiendrait déjà sur une seule carte.
  • À éviter : les paires de GPU dépareillées (par ex. une 5060 Ti + une 4060 Ti) — la performance en tensor-split est limitée par la carte la plus lente, et les incompatibilités de pilotes entre générations de GPU causent de l'instabilité.

Pourquoi deux GPU plutôt qu'un GPU plus gros

À $2,000, une configuration mono-GPU plafonne autour d'une RTX 3090 24 Go d'occasion ou d'une RTX 5070 Ti 16 Go — aucune n'atteint la capacité de classe 70B. llama.cpp et vLLM supportent tous deux l'inférence tensor-split, qui répartit les couches d'un modèle sur plusieurs GPU connectés à la même carte mère, traitant leur VRAM combinée comme un seul pool. Deux cartes RTX 5060 Ti 16 Go offrent 32 Go de VRAM combinée pour moins cher qu'une seule carte 24 Go, et dépassent confortablement ce dont un modèle 70B a besoin en Q4 (~40 Go de budget système+VRAM au total, le modèle lui-même nécessitant environ 38-40 Go réparti sur les deux cartes en Q4).

Cela ne fonctionne que parce que les deux cartes sont du même modèle — une VRAM ou un calcul dépareillés entre les cartes force la répartition à se limiter à la carte la plus faible, et des exigences de pilotes dépareillées entre générations de GPU peuvent causer une instabilité pure et simple.

📍 En une phrase

Deux GPU 16 Go assortis mis en commun via l'inférence tensor-split offrent plus de VRAM utilisable par dollar qu'un seul GPU plus gros au même budget de $2,000.

💬 En termes simples

Le tensor-split = un logiciel qui répartit les couches d'un modèle sur deux GPU pour que leur VRAM s'additionne, comme un RAID pour la mémoire graphique.

VRAM nécessaire selon la taille du modèle en quantification Q4 : 7B nécessite env. 5GB, 14B env. 9GB et 32B env. 15GB — tout tient sur la carte 16GB du build à 1 000 $. 70B nécessite env. 40GB, ce qui exige les 32GB de VRAM combinée de la double GPU du build à 2 000 $.
VRAM nécessaire selon la taille du modèle en quantification Q4 : 7B nécessite env. 5GB, 14B env. 9GB et 32B env. 15GB — tout tient sur la carte 16GB du build à 1 000 $. 70B nécessite env. 40GB, ce qui exige les 32GB de VRAM combinée de la double GPU du build à 2 000 $.

Liste de pièces complète

Les prix sont des prix courants de juillet 2026 et varient selon la région et le revendeur.

ComposantChoixPrixPourquoi
GPU (x2)2x RTX 5060 Ti 16 Go$86032 Go de VRAM combinée via tensor-split — l'objectif central de cette configuration
CPUAMD Ryzen 7 9700X$3308 cœurs gèrent la surcharge PCIe/pilotes de deux GPU et toute couche déchargée sur le CPU
RAM64 Go DDR5-6000 (2x32 Go)$180Les modèles plus grands et la surcharge des pilotes double-GPU nécessitent plus de marge qu'une configuration mono-GPU
StockageSSD NVMe Gen4 2 To$130Les modèles 70B en Q4 utilisent à eux seuls ~40 Go ; une bibliothèque multi-modèles a besoin de l'espace supplémentaire
Carte mèreB650 ATX avec support PCIe x8/x8$180Doit répartir les voies PCIe en x8/x8, pas x16/x4, pour éviter un goulot d'étranglement en tensor-split
Alimentation850W 80+ Gold$130Deux cartes RTX 5060 Ti consomment ~360W combinés ; 850W laisse de la marge pour les pics transitoires
BoîtierMid-tower ATX (dégagement double GPU)$90Nécessite un espacement entre deux GPU double-slot pour une circulation d'air adéquate
Ventirad CPUVentirad air milieu de gamme$40Le Ryzen 7 9700X sous charge d'inférence double-GPU soutenue bénéficie d'un refroidissement supérieur au stock
Consommation système estimée face à la capacité de l'alimentation : le build à 1 000 $ à une seule GPU consomme env. 285W sur une alimentation 650W (56% de marge) ; le build à 2 000 $ à double GPU consomme env. 475W sur une alimentation 850W (44% de marge).
Consommation système estimée face à la capacité de l'alimentation : le build à 1 000 $ à une seule GPU consomme env. 285W sur une alimentation 650W (56% de marge) ; le build à 2 000 $ à double GPU consomme env. 475W sur une alimentation 850W (44% de marge).

L'exigence de carte mère que la plupart des constructeurs manquent

Deux slots physiques PCIe x16 ne garantissent pas deux connexions électriques x16. De nombreuses cartes mères grand public câblent le second slot en x4 électrique, même s'il est physiquement au format x16. Pour l'inférence LLM en tensor-split, les deux GPU transfèrent activement des données à chaque passe avant — un second slot en x4 devient un véritable goulot d'étranglement, pas seulement théorique.

Avant d'acheter une carte mère, vérifiez sa fiche technique pour "allocation des voies PCIe" ou "mode x8/x8" — c'est généralement indiqué explicitement pour les cartes qui le supportent, car cela nécessite un chipset avec suffisamment de voies PCIe natives pour répartir équitablement. Cette configuration suppose une carte B650 ATX qui indique explicitement le support x8/x8.

  • Confirmez x8/x8, pas x16/x4 : Vérifiez le schéma des voies PCIe du manuel de la carte mère, pas seulement le nombre de slots physiques.
  • L'espacement des slots compte aussi physiquement : Deux GPU double-slot ont besoin d'au moins un slot vide de dégagement entre eux pour la circulation d'air — vérifiez l'espacement des slots sur le plan de la carte, pas seulement l'allocation des voies.
  • La génération PCIe compte moins que le nombre de voies pour cette charge de travail — le PCIe 4.0 x8 dépasse déjà ce dont le transfert tensor-split a réellement besoin ; viser des slots PCIe 5.0 ne vaut pas la prime de prix ici.

Performances attendues par taille de modèle

Tous les chiffres sont en quantification Q4_K_M mesurés avec llama.cpp en tensor-split sur deux cartes RTX 5060 Ti 16 Go. Les chiffres mono-GPU utilisent une seule carte.

Taille du modèleConfigurationVRAM utilisée (Q4)Tokens/s
7B-14BGPU unique (pas de split nécessaire)~4.5-9 Go55-65 (7B) / 28-35 (14B)
32BGPU unique~14.5-15.5 Go25-30 (pleine marge de contexte par rapport à la configuration $1,000)
32BTensor-split (deux GPU)~15 Go répartis30-38 (la répartition aide même quand ça tient sur une carte)
70BTensor-split (deux GPU, requis)~38-40 Go répartis12-18
Tokens/s selon la taille du modèle, quantification Q4 : les deux builds sont à égalité en 7B (env. 60 tok/s) et 14B (env. 31 tok/s), mais le build à 2 000 $ à double GPU prend l'avantage en 32B via le tensor-split (env. 34 contre env. 13 tok/s) et est le seul à exécuter le 70B (env. 15 tok/s).
Tokens/s selon la taille du modèle, quantification Q4 : les deux builds sont à égalité en 7B (env. 60 tok/s) et 14B (env. 31 tok/s), mais le build à 2 000 $ à double GPU prend l'avantage en 32B via le tensor-split (env. 34 contre env. 13 tok/s) et est le seul à exécuter le 70B (env. 15 tok/s).

Configurer l'inférence tensor-split

llama.cpp gère le tensor-split avec un seul indicateur en ligne de commande une fois que les deux GPU sont reconnus par le pilote. Après avoir confirmé que les deux cartes RTX 5060 Ti apparaissent dans `nvidia-smi`, lancez un modèle avec `--tensor-split 1,1` pour répartir les couches équitablement entre elles, ou ajustez le ratio (par ex. `--tensor-split 1,1.2`) si une carte pilote aussi un affichage et a besoin d'un peu moins de VRAM réservée pour le modèle.

Ollama supporte le multi-GPU automatiquement depuis ses versions récentes — il détecte la VRAM disponible sur tous les GPU installés et répartit les gros modèles sans configuration manuelle, bien que les indicateurs manuels de llama.cpp offrent un contrôle plus précis sur le ratio de répartition.

  • Vérifiez que les deux GPU sont détectés : `nvidia-smi` doit lister les deux cartes avec des versions de pilote correspondantes avant de tenter une répartition.
  • Commencez par une répartition égale : `--tensor-split 1,1` dans llama.cpp est le réglage par défaut correct pour deux cartes identiques.
  • Surveillez la saturation de bande passante PCIe : si les tokens/s sont largement inférieurs à la plage attendue, confirmez que la carte mère tourne bien en x8/x8 et ne retombe pas silencieusement en x4.

Voie d'évolution

L'évolution la plus claire à partir de cette configuration consiste à ajouter une troisième RTX 5060 Ti 16 Go si la carte mère dispose d'un troisième slot PCIe avec une bande passante utilisable, portant la VRAM combinée à 48 Go — suffisant pour des quantifications plus élevées de modèles 70B ou une marge confortable pour des fenêtres de contexte plus longues.

Une évolution plus coûteuse mais plus simple consiste à remplacer les deux cartes RTX 5060 Ti par deux cartes RTX 5070 Ti 16 Go plus tard, en gardant le même plafond de 32 Go de VRAM mais en augmentant le calcul brut et la bande passante mémoire, ce qui améliore les tokens/s sans changer les tailles de modèles qui tiennent.

Erreurs courantes à ce budget

  • Acheter une carte mère uniquement sur la base du marketing "supporte SLI/CrossFire" — ce terme marketing fait référence au rendu multi-GPU pour le jeu vidéo, pas à l'allocation de voies PCIe pour les charges de calcul, et ne garantit pas le x8/x8.
  • Mélanger des générations de GPU (par ex. une RTX 5060 Ti + une RTX 4060 Ti) pour économiser de l'argent — la performance en tensor-split est limitée par la carte la plus lente/ancienne, effaçant l'essentiel du bénéfice de la plus récente.
  • Sous-estimer la marge de l'alimentation — deux GPU consommant près de leur TDP combiné nominal simultanément pendant une longue génération peuvent piquer brièvement bien au-dessus de 360W ; une alimentation sous-dimensionnée cause des arrêts aléatoires sous charge, pas un ralentissement progressif.
  • Supposer que doubler les GPU double les tokens/s — le tensor-split ajoute une surcharge de transfert PCIe entre les couches, donc le débit combiné est nettement inférieur à 2x la vitesse d'une seule carte sur les modèles qui tiennent déjà sur un seul GPU.

Questions fréquemment posées

Un PC à $2,000 peut-il faire tourner des LLM locaux 70B ?

Oui, en utilisant deux cartes RTX 5060 Ti 16 Go dans une configuration tensor-split, qui met en commun 32 Go de VRAM combinée — suffisant pour des modèles 70B en quantification Q4, tournant à 12-18 tokens par seconde.

Pourquoi utiliser deux GPU 16 Go plutôt qu'un seul GPU 24 Go ou 32 Go ?

Deux GPU 16 Go assortis offrent plus de VRAM combinée par dollar qu'une seule carte plus grande au même budget, et la fonctionnalité tensor-split de llama.cpp permet à la VRAM des deux cartes de fonctionner comme un seul pool pour l'inférence.

La carte mère compte-t-elle pour une configuration double-GPU pour LLM local ?

Oui, significativement. La carte doit supporter l'allocation de voies PCIe x8/x8 sur les deux slots GPU — une carte qui fait tourner le second slot en x4 électrique crée un véritable goulot d'étranglement de bande passante durant l'inférence tensor-split, pas seulement théorique.

Puis-je mélanger différents modèles de GPU dans une configuration double-GPU ?

Non recommandé. La performance en tensor-split est limitée par la carte la plus lente ou la plus ancienne de la paire, et des exigences de pilotes dépareillées entre générations de GPU peuvent causer de l'instabilité. Utilisez deux GPU identiques.

Doubler les GPU double-t-il les tokens par seconde ?

Non. Le tensor-split ajoute une surcharge de transfert PCIe entre les couches réparties sur les cartes, donc le débit combiné sur un modèle qui tient déjà sur un seul GPU est nettement inférieur à 2x la vitesse de cette carte unique. Le bénéfice est de pouvoir faire tourner des modèles plus gros, pas une mise à l'échelle linéaire de la vitesse.

Ollama ou llama.cpp est-il préférable pour l'inférence multi-GPU en tensor-split ?

Ollama détecte automatiquement plusieurs GPU et ne nécessite aucune configuration manuelle, ce qui est plus simple pour la plupart des utilisateurs. L'indicateur manuel --tensor-split de llama.cpp offre un contrôle plus précis sur le ratio de répartition, utile si un GPU pilote aussi un affichage et a besoin de moins de VRAM réservée.

Dans quelle mesure la bande passante PCIe affecte-t-elle réellement la performance en tensor-split ?

De façon significative si le slot tourne en x4 au lieu de x8. Le PCIe 4.0 x8 offre déjà plus de bande passante que ce dont l'inférence tensor-split a généralement besoin, mais le x4 devient un véritable goulot d'étranglement puisque les deux GPU transfèrent activement des données à chaque passe avant.

Cette configuration peut-elle faire tourner des modèles plus petits plus rapidement en utilisant un seul GPU ?

Oui — pour les modèles qui tiennent déjà dans 16 Go (jusqu'à 32B en Q4), tourner sur une seule RTX 5060 Ti évite entièrement la surcharge PCIe du tensor-split et est plus rapide que de répartir un modèle qui n'avait pas besoin de l'être.

Quelle est la consommation électrique totale de deux cartes RTX 5060 Ti ?

Environ 360W combinés à pleine charge (180W de TDP nominal chacune), avec de brefs pics transitoires au-dessus de cette valeur. Une alimentation 850W 80+ Gold laisse une marge confortable pour le reste du système en plus de ces pics.

Quelle est la voie d'évolution au-delà de cette configuration ?

Ajouter une troisième RTX 5060 Ti 16 Go assortie (si la carte mère dispose d'un troisième slot PCIe utilisable) porte la VRAM combinée à 48 Go. Autre option, remplacer les deux cartes par des RTX 5070 Ti 16 Go plus tard conserve le même plafond de 32 Go mais augmente le calcul et la bande passante mémoire.

Note sur les faits tiers

Cet article fait référence à des modèles d’IA, des benchmarks, des prix et des licences de tiers. Le paysage de l’IA évolue rapidement. Les scores de benchmark, les conditions de licence, les noms de modèles et les prix des API peuvent changer entre le moment de la rédaction et le moment où vous lisez ceci. Avant de prendre des décisions de déploiement ou de conformité basées sur cet article, vérifiez les chiffres actuels auprès de la source officielle de chaque fournisseur : fiches de modèles Hugging Face pour les licences et benchmarks, sites web des fournisseurs pour les prix API, et EUR-Lex pour les textes RGPD et AI Act actuels. Cet article reflète les informations publiques disponibles en mai 2026.

Utilisez PromptQuorum avec un LLM local, vos propres clés API, ou les deux — vous choisissez le backend.

Rejoindre la liste d'attente PromptQuorum →

← Retour aux LLMs locaux