Points clés
- Coût total de la configuration : ~$1,940. Deux RTX 5060 Ti 16 Go ($860 au total), Ryzen 7 9700X ($330), 64 Go DDR5-6000 ($180), NVMe Gen4 2 To ($130), carte mère B650 ATX avec slots x8/x8 ($180), alimentation 850W 80+ Gold ($130), boîtier ATX ($90).
- Deux GPU 16 Go battent un GPU 24 Go sur le rapport VRAM/prix. 32 Go de VRAM combinée pour ~$860 bat une RTX 3090 24 Go d'occasion (~$700-750 pour moins de VRAM au total) et coûte bien moins qu'une seule carte de station de travail 32 Go.
- Les modèles 70B tiennent et tournent à 12-18 tok/s via le tensor-split de llama.cpp réparti sur les deux cartes — c'est la raison même pour laquelle cette configuration utilise deux GPU plutôt qu'un seul plus gros.
- La carte mère doit supporter la bifurcation PCIe x8/x8, pas seulement deux slots physiques x16. Une carte qui fait tourner le second slot en x4 électrique crée un véritable goulot d'étranglement de bande passante pour l'inférence tensor-split.
- Le repli mono-GPU fonctionne toujours bien : pour les modèles plus petits, tourner sur une seule RTX 5060 Ti donne du 32B à 25-30 tok/s — plus rapide que de répartir un modèle qui tiendrait déjà sur une seule carte.
- À éviter : les paires de GPU dépareillées (par ex. une 5060 Ti + une 4060 Ti) — la performance en tensor-split est limitée par la carte la plus lente, et les incompatibilités de pilotes entre générations de GPU causent de l'instabilité.
Pourquoi deux GPU plutôt qu'un GPU plus gros
À $2,000, une configuration mono-GPU plafonne autour d'une RTX 3090 24 Go d'occasion ou d'une RTX 5070 Ti 16 Go — aucune n'atteint la capacité de classe 70B. llama.cpp et vLLM supportent tous deux l'inférence tensor-split, qui répartit les couches d'un modèle sur plusieurs GPU connectés à la même carte mère, traitant leur VRAM combinée comme un seul pool. Deux cartes RTX 5060 Ti 16 Go offrent 32 Go de VRAM combinée pour moins cher qu'une seule carte 24 Go, et dépassent confortablement ce dont un modèle 70B a besoin en Q4 (~40 Go de budget système+VRAM au total, le modèle lui-même nécessitant environ 38-40 Go réparti sur les deux cartes en Q4).
Cela ne fonctionne que parce que les deux cartes sont du même modèle — une VRAM ou un calcul dépareillés entre les cartes force la répartition à se limiter à la carte la plus faible, et des exigences de pilotes dépareillées entre générations de GPU peuvent causer une instabilité pure et simple.
📍 En une phrase
Deux GPU 16 Go assortis mis en commun via l'inférence tensor-split offrent plus de VRAM utilisable par dollar qu'un seul GPU plus gros au même budget de $2,000.
💬 En termes simples
Le tensor-split = un logiciel qui répartit les couches d'un modèle sur deux GPU pour que leur VRAM s'additionne, comme un RAID pour la mémoire graphique.
Liste de pièces complète
Les prix sont des prix courants de juillet 2026 et varient selon la région et le revendeur.
| Composant | Choix | Prix | Pourquoi |
|---|---|---|---|
| GPU (x2) | 2x RTX 5060 Ti 16 Go | $860 | 32 Go de VRAM combinée via tensor-split — l'objectif central de cette configuration |
| CPU | AMD Ryzen 7 9700X | $330 | 8 cœurs gèrent la surcharge PCIe/pilotes de deux GPU et toute couche déchargée sur le CPU |
| RAM | 64 Go DDR5-6000 (2x32 Go) | $180 | Les modèles plus grands et la surcharge des pilotes double-GPU nécessitent plus de marge qu'une configuration mono-GPU |
| Stockage | SSD NVMe Gen4 2 To | $130 | Les modèles 70B en Q4 utilisent à eux seuls ~40 Go ; une bibliothèque multi-modèles a besoin de l'espace supplémentaire |
| Carte mère | B650 ATX avec support PCIe x8/x8 | $180 | Doit répartir les voies PCIe en x8/x8, pas x16/x4, pour éviter un goulot d'étranglement en tensor-split |
| Alimentation | 850W 80+ Gold | $130 | Deux cartes RTX 5060 Ti consomment ~360W combinés ; 850W laisse de la marge pour les pics transitoires |
| Boîtier | Mid-tower ATX (dégagement double GPU) | $90 | Nécessite un espacement entre deux GPU double-slot pour une circulation d'air adéquate |
| Ventirad CPU | Ventirad air milieu de gamme | $40 | Le Ryzen 7 9700X sous charge d'inférence double-GPU soutenue bénéficie d'un refroidissement supérieur au stock |
L'exigence de carte mère que la plupart des constructeurs manquent
Deux slots physiques PCIe x16 ne garantissent pas deux connexions électriques x16. De nombreuses cartes mères grand public câblent le second slot en x4 électrique, même s'il est physiquement au format x16. Pour l'inférence LLM en tensor-split, les deux GPU transfèrent activement des données à chaque passe avant — un second slot en x4 devient un véritable goulot d'étranglement, pas seulement théorique.
Avant d'acheter une carte mère, vérifiez sa fiche technique pour "allocation des voies PCIe" ou "mode x8/x8" — c'est généralement indiqué explicitement pour les cartes qui le supportent, car cela nécessite un chipset avec suffisamment de voies PCIe natives pour répartir équitablement. Cette configuration suppose une carte B650 ATX qui indique explicitement le support x8/x8.
- Confirmez x8/x8, pas x16/x4 : Vérifiez le schéma des voies PCIe du manuel de la carte mère, pas seulement le nombre de slots physiques.
- L'espacement des slots compte aussi physiquement : Deux GPU double-slot ont besoin d'au moins un slot vide de dégagement entre eux pour la circulation d'air — vérifiez l'espacement des slots sur le plan de la carte, pas seulement l'allocation des voies.
- La génération PCIe compte moins que le nombre de voies pour cette charge de travail — le PCIe 4.0 x8 dépasse déjà ce dont le transfert tensor-split a réellement besoin ; viser des slots PCIe 5.0 ne vaut pas la prime de prix ici.
Performances attendues par taille de modèle
Tous les chiffres sont en quantification Q4_K_M mesurés avec llama.cpp en tensor-split sur deux cartes RTX 5060 Ti 16 Go. Les chiffres mono-GPU utilisent une seule carte.
| Taille du modèle | Configuration | VRAM utilisée (Q4) | Tokens/s |
|---|---|---|---|
| 7B-14B | GPU unique (pas de split nécessaire) | ~4.5-9 Go | 55-65 (7B) / 28-35 (14B) |
| 32B | GPU unique | ~14.5-15.5 Go | 25-30 (pleine marge de contexte par rapport à la configuration $1,000) |
| 32B | Tensor-split (deux GPU) | ~15 Go répartis | 30-38 (la répartition aide même quand ça tient sur une carte) |
| 70B | Tensor-split (deux GPU, requis) | ~38-40 Go répartis | 12-18 |
Configurer l'inférence tensor-split
llama.cpp gère le tensor-split avec un seul indicateur en ligne de commande une fois que les deux GPU sont reconnus par le pilote. Après avoir confirmé que les deux cartes RTX 5060 Ti apparaissent dans `nvidia-smi`, lancez un modèle avec `--tensor-split 1,1` pour répartir les couches équitablement entre elles, ou ajustez le ratio (par ex. `--tensor-split 1,1.2`) si une carte pilote aussi un affichage et a besoin d'un peu moins de VRAM réservée pour le modèle.
Ollama supporte le multi-GPU automatiquement depuis ses versions récentes — il détecte la VRAM disponible sur tous les GPU installés et répartit les gros modèles sans configuration manuelle, bien que les indicateurs manuels de llama.cpp offrent un contrôle plus précis sur le ratio de répartition.
- Vérifiez que les deux GPU sont détectés : `nvidia-smi` doit lister les deux cartes avec des versions de pilote correspondantes avant de tenter une répartition.
- Commencez par une répartition égale : `--tensor-split 1,1` dans llama.cpp est le réglage par défaut correct pour deux cartes identiques.
- Surveillez la saturation de bande passante PCIe : si les tokens/s sont largement inférieurs à la plage attendue, confirmez que la carte mère tourne bien en x8/x8 et ne retombe pas silencieusement en x4.
Voie d'évolution
L'évolution la plus claire à partir de cette configuration consiste à ajouter une troisième RTX 5060 Ti 16 Go si la carte mère dispose d'un troisième slot PCIe avec une bande passante utilisable, portant la VRAM combinée à 48 Go — suffisant pour des quantifications plus élevées de modèles 70B ou une marge confortable pour des fenêtres de contexte plus longues.
Une évolution plus coûteuse mais plus simple consiste à remplacer les deux cartes RTX 5060 Ti par deux cartes RTX 5070 Ti 16 Go plus tard, en gardant le même plafond de 32 Go de VRAM mais en augmentant le calcul brut et la bande passante mémoire, ce qui améliore les tokens/s sans changer les tailles de modèles qui tiennent.
Erreurs courantes à ce budget
- Acheter une carte mère uniquement sur la base du marketing "supporte SLI/CrossFire" — ce terme marketing fait référence au rendu multi-GPU pour le jeu vidéo, pas à l'allocation de voies PCIe pour les charges de calcul, et ne garantit pas le x8/x8.
- Mélanger des générations de GPU (par ex. une RTX 5060 Ti + une RTX 4060 Ti) pour économiser de l'argent — la performance en tensor-split est limitée par la carte la plus lente/ancienne, effaçant l'essentiel du bénéfice de la plus récente.
- Sous-estimer la marge de l'alimentation — deux GPU consommant près de leur TDP combiné nominal simultanément pendant une longue génération peuvent piquer brièvement bien au-dessus de 360W ; une alimentation sous-dimensionnée cause des arrêts aléatoires sous charge, pas un ralentissement progressif.
- Supposer que doubler les GPU double les tokens/s — le tensor-split ajoute une surcharge de transfert PCIe entre les couches, donc le débit combiné est nettement inférieur à 2x la vitesse d'une seule carte sur les modèles qui tiennent déjà sur un seul GPU.
Questions fréquemment posées
Un PC à $2,000 peut-il faire tourner des LLM locaux 70B ?
Oui, en utilisant deux cartes RTX 5060 Ti 16 Go dans une configuration tensor-split, qui met en commun 32 Go de VRAM combinée — suffisant pour des modèles 70B en quantification Q4, tournant à 12-18 tokens par seconde.
Pourquoi utiliser deux GPU 16 Go plutôt qu'un seul GPU 24 Go ou 32 Go ?
Deux GPU 16 Go assortis offrent plus de VRAM combinée par dollar qu'une seule carte plus grande au même budget, et la fonctionnalité tensor-split de llama.cpp permet à la VRAM des deux cartes de fonctionner comme un seul pool pour l'inférence.
La carte mère compte-t-elle pour une configuration double-GPU pour LLM local ?
Oui, significativement. La carte doit supporter l'allocation de voies PCIe x8/x8 sur les deux slots GPU — une carte qui fait tourner le second slot en x4 électrique crée un véritable goulot d'étranglement de bande passante durant l'inférence tensor-split, pas seulement théorique.
Puis-je mélanger différents modèles de GPU dans une configuration double-GPU ?
Non recommandé. La performance en tensor-split est limitée par la carte la plus lente ou la plus ancienne de la paire, et des exigences de pilotes dépareillées entre générations de GPU peuvent causer de l'instabilité. Utilisez deux GPU identiques.
Doubler les GPU double-t-il les tokens par seconde ?
Non. Le tensor-split ajoute une surcharge de transfert PCIe entre les couches réparties sur les cartes, donc le débit combiné sur un modèle qui tient déjà sur un seul GPU est nettement inférieur à 2x la vitesse de cette carte unique. Le bénéfice est de pouvoir faire tourner des modèles plus gros, pas une mise à l'échelle linéaire de la vitesse.
Ollama ou llama.cpp est-il préférable pour l'inférence multi-GPU en tensor-split ?
Ollama détecte automatiquement plusieurs GPU et ne nécessite aucune configuration manuelle, ce qui est plus simple pour la plupart des utilisateurs. L'indicateur manuel --tensor-split de llama.cpp offre un contrôle plus précis sur le ratio de répartition, utile si un GPU pilote aussi un affichage et a besoin de moins de VRAM réservée.
Dans quelle mesure la bande passante PCIe affecte-t-elle réellement la performance en tensor-split ?
De façon significative si le slot tourne en x4 au lieu de x8. Le PCIe 4.0 x8 offre déjà plus de bande passante que ce dont l'inférence tensor-split a généralement besoin, mais le x4 devient un véritable goulot d'étranglement puisque les deux GPU transfèrent activement des données à chaque passe avant.
Cette configuration peut-elle faire tourner des modèles plus petits plus rapidement en utilisant un seul GPU ?
Oui — pour les modèles qui tiennent déjà dans 16 Go (jusqu'à 32B en Q4), tourner sur une seule RTX 5060 Ti évite entièrement la surcharge PCIe du tensor-split et est plus rapide que de répartir un modèle qui n'avait pas besoin de l'être.
Quelle est la consommation électrique totale de deux cartes RTX 5060 Ti ?
Environ 360W combinés à pleine charge (180W de TDP nominal chacune), avec de brefs pics transitoires au-dessus de cette valeur. Une alimentation 850W 80+ Gold laisse une marge confortable pour le reste du système en plus de ces pics.
Quelle est la voie d'évolution au-delà de cette configuration ?
Ajouter une troisième RTX 5060 Ti 16 Go assortie (si la carte mère dispose d'un troisième slot PCIe utilisable) porte la VRAM combinée à 48 Go. Autre option, remplacer les deux cartes par des RTX 5070 Ti 16 Go plus tard conserve le même plafond de 32 Go mais augmente le calcul et la bande passante mémoire.