Skip to main content
PromptQuorumPromptQuorum
Início/LLMs locais/Build de PC para LLM Local por $2.000 (2026): Lista de Peças Dual-GPU com 32GB de VRAM
Hardware Setups

Build de PC para LLM Local por $2.000 (2026): Lista de Peças Dual-GPU com 32GB de VRAM

·10 min de leitura·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

Um build de PC para LLM local de $2.000 consegue a maior VRAM por dólar usando duas GPUs de 16GB em vez de uma única placa de 24GB. Duas placas RTX 5060 Ti 16GB ($430 cada, $860 no total) fornecem 32GB de VRAM combinada — suficiente para rodar modelos 70B em Q4 via inferência tensor-split — combinadas com um Ryzen 7 9700X ($330), 64GB de DDR5-6000 ($180), um SSD NVMe Gen4 de 2TB ($130), uma placa-mãe B650 ATX com slots PCIe x8/x8 ($180), uma fonte 850W 80+ Gold ($130), e um gabinete ATX ($90), totalizando aproximadamente $1.940. Ele executa modelos 70B Q4 a 12-18 tok/s divididos entre as duas placas, ou um único modelo 32B a 25-30 tok/s em apenas uma placa.

Um PC de $2.000 com duas placas RTX 5060 Ti 16GB (32GB de VRAM combinada), um Ryzen 7 9700X e 64GB de RAM DDR5 executa modelos de classe 70B através de inferência multi-GPU com tensor-split — algo que nenhuma GPU única de $2.000 consegue fazer. Em vez de comprar uma única placa cara de 24GB, este build combina duas placas intermediárias de 16GB via PCIe usando o modo tensor-split do llama.cpp, dobrando a capacidade de VRAM por menos do que o preço de uma única RTX 5090. Este guia cobre as peças exatas, o requisito de placa-mãe que faz o dual-GPU funcionar corretamente, e velocidades reais de tokens por segundo.

Key Takeaways

  • Custo total do build: ~$1.940. Duas RTX 5060 Ti 16GB ($860 combinado), Ryzen 7 9700X ($330), 64GB DDR5-6000 ($180), 2TB NVMe Gen4 ($130), placa-mãe B650 ATX com slots x8/x8 ($180), fonte 850W 80+ Gold ($130), gabinete ATX ($90).
  • Duas GPUs de 16GB superam uma GPU de 24GB em VRAM por dólar. 32GB de VRAM combinada por ~$860 supera uma RTX 3090 24GB usada (~$700-750 por menos VRAM total) e custa muito menos do que uma única placa de workstation de 32GB.
  • Modelos 70B cabem e rodam a 12-18 tok/s via tensor-split do llama.cpp entre as duas placas — a razão inteira pela qual este build usa duas GPUs em vez de uma maior.
  • A placa-mãe precisa suportar bifurcação PCIe x8/x8, não apenas dois slots físicos x16. Uma placa que roda o segundo slot em x4 elétrico cria um gargalo real de largura de banda para a inferência tensor-split.
  • O fallback de GPU única ainda funciona bem: para modelos menores, rodar em apenas uma RTX 5060 Ti dá 32B a 25-30 tok/s — mais rápido do que dividir um modelo que já cabia em uma única placa.
  • Evite: pares de GPU incompatíveis (por exemplo, uma 5060 Ti + uma 4060 Ti) — o desempenho do tensor-split é limitado pela placa mais lenta, e incompatibilidades de driver entre gerações de GPU causam instabilidade.

Por Que Duas GPUs Em Vez de Uma GPU Maior

Com $2.000, um build de GPU única chega no máximo a uma RTX 3090 24GB usada ou uma RTX 5070 Ti 16GB — nenhuma das duas alcança a capacidade de classe 70B. Tanto o llama.cpp quanto o vLLM suportam inferência tensor-split, que divide as camadas de um modelo entre múltiplas GPUs conectadas à mesma placa-mãe, tratando a VRAM combinada como um único pool. Duas placas RTX 5060 Ti 16GB dão 32GB de VRAM combinada por menos dinheiro do que uma única placa de 24GB, e excede confortavelmente o que um modelo 70B precisa em Q4 (~40GB de orçamento total de sistema+VRAM, com o modelo em si precisando de cerca de 38-40GB entre as duas placas em Q4).

Isso só funciona porque as duas placas são do mesmo modelo — VRAM ou poder de computação incompatíveis entre as placas força o split a ficar limitado pela placa mais fraca, e requisitos de driver incompatíveis entre gerações de GPU podem causar instabilidade completa.

Duas GPUs de 16GB idênticas combinadas via inferência tensor-split entregam mais VRAM utilizável por dólar do que uma única GPU maior no mesmo orçamento de $2.000.

Tensor-split = software que espalha as camadas de um modelo entre duas GPUs para que a VRAM delas se some, como um RAID para memória gráfica.

VRAM necessária por tamanho de modelo na quantização Q4: 7B precisa de ~5GB, 14B ~9GB e 32B ~15GB — tudo cabe na placa de 16GB do build de $1.000. O 70B precisa de ~40GB, o que exige os 32GB de VRAM combinada das duas GPUs do build de $2.000.
VRAM necessária por tamanho de modelo na quantização Q4: 7B precisa de ~5GB, 14B ~9GB e 32B ~15GB — tudo cabe na placa de 16GB do build de $1.000. O 70B precisa de ~40GB, o que exige os 32GB de VRAM combinada das duas GPUs do build de $2.000.

Lista Completa de Peças

Os preços são preços de mercado em julho de 2026 e variam por região e revendedor.

ComponenteEscolhaPreçoPor Quê
GPU (x2)2x RTX 5060 Ti 16GB$86032GB de VRAM combinada via tensor-split — o propósito central deste build
CPUAMD Ryzen 7 9700X$3308 núcleos lidam com a sobrecarga de PCIe/driver de duas GPUs e quaisquer camadas transferidas para a CPU
RAM64GB DDR5-6000 (2x32GB)$180Modelos maiores e a sobrecarga de driver dual-GPU precisam de mais margem do que um build de GPU única
Armazenamento2TB NVMe Gen4 SSD$130Modelos 70B em Q4 sozinhos usam ~40GB; uma biblioteca com múltiplos modelos precisa do espaço extra
Placa-mãeB650 ATX com suporte PCIe x8/x8$180Precisa dividir as lanes PCIe em x8/x8, não x16/x4, para evitar um gargalo de largura de banda no tensor-split
Fonte850W 80+ Gold$130Duas placas RTX 5060 Ti consomem ~360W combinados; 850W deixa margem para picos transitórios
GabineteATX mid-tower (espaço para dual-GPU)$90Precisa de espaçamento entre duas GPUs de slot duplo para fluxo de ar adequado
Cooler da CPUAir cooler intermediário$40O Ryzen 7 9700X sob carga sustentada de inferência dual-GPU se beneficia de um resfriamento melhor que o original
Consumo estimado do sistema em comparação com a capacidade da fonte: o build de $1.000 com uma única GPU consome ~285W de uma fonte de 650W (56% de folga); o build de $2.000 com duas GPUs consome ~475W de uma fonte de 850W (44% de folga).
Consumo estimado do sistema em comparação com a capacidade da fonte: o build de $1.000 com uma única GPU consome ~285W de uma fonte de 650W (56% de folga); o build de $2.000 com duas GPUs consome ~475W de uma fonte de 850W (44% de folga).

O Requisito de Placa-Mãe Que a Maioria dos Construtores Ignora

Dois slots físicos PCIe x16 não garantem duas conexões elétricas x16. Muitas placas-mãe de consumo conectam o segundo slot em x4 elétrico, mesmo que ele seja fisicamente do tamanho x16. Para a inferência de LLM com tensor-split, ambas as GPUs transferem dados ativamente durante cada forward pass — um segundo slot x4 se torna um gargalo real, não teórico.

Antes de comprar uma placa-mãe, verifique a ficha técnica em busca de "alocação de lanes PCIe" ou "modo x8/x8" — isso geralmente é listado explicitamente para placas que suportam esse recurso, já que exige um chipset com lanes PCIe nativas suficientes para dividir igualmente. Este build assume uma placa B650 ATX que lista explicitamente suporte a x8/x8.

  • Confirme x8/x8, não x16/x4: Verifique o diagrama de lanes PCIe no manual da placa-mãe, não apenas o número de slots físicos.
  • O espaçamento físico dos slots também importa: Duas GPUs de slot duplo precisam de pelo menos um slot vazio de folga entre elas para fluxo de ar — verifique o espaçamento dos slots no layout da placa, não apenas a alocação de lanes.
  • A geração do PCIe importa menos do que a quantidade de lanes para essa carga de trabalho — PCIe 4.0 x8 já excede o que a transferência do tensor-split realmente precisa; buscar slots PCIe 5.0 não vale um preço mais alto aqui.

Desempenho Esperado por Tamanho de Modelo

Todos os números são de quantização Q4_K_M medidos com tensor-split do llama.cpp entre duas placas RTX 5060 Ti 16GB. Os números de GPU única usam apenas uma placa.

Tamanho do ModeloConfiguraçãoVRAM Usada (Q4)Tokens/seg
7B-14BGPU única (sem necessidade de split)~4.5-9GB55-65 (7B) / 28-35 (14B)
32BGPU única~14.5-15.5GB25-30 (folga total de contexto vs. o build de $1.000)
32BTensor-split (ambas as GPUs)~15GB dividida30-38 (o split ajuda mesmo quando cabe em uma única placa)
70BTensor-split (ambas as GPUs, obrigatório)~38-40GB dividida12-18
Tokens/s por tamanho de modelo, quantização Q4: os dois builds empatam em 7B (~60 tok/s) e 14B (~31 tok/s), mas o build de $2.000 com duas GPUs se destaca no 32B via tensor-split (~34 contra ~13 tok/s) e é o único que roda o 70B (~15 tok/s).
Tokens/s por tamanho de modelo, quantização Q4: os dois builds empatam em 7B (~60 tok/s) e 14B (~31 tok/s), mas o build de $2.000 com duas GPUs se destaca no 32B via tensor-split (~34 contra ~13 tok/s) e é o único que roda o 70B (~15 tok/s).

Configurando a Inferência Tensor-Split

O llama.cpp lida com o tensor-split através de uma única flag de linha de comando assim que ambas as GPUs são reconhecidas pelo driver. Depois de confirmar que as duas placas RTX 5060 Ti aparecem no `nvidia-smi`, inicie um modelo com `--tensor-split 1,1` para dividir as camadas igualmente entre elas, ou ajuste a proporção (por exemplo, `--tensor-split 1,1.2`) se uma das placas também estiver conectada a um monitor e precisar de um pouco menos de VRAM reservada para o modelo.

O Ollama suporta multi-GPU automaticamente nas versões recentes — ele detecta a VRAM disponível em todas as GPUs instaladas e divide modelos grandes sem configuração manual, embora as flags manuais do llama.cpp deem um controle mais preciso sobre a proporção do split.

  • Verifique se ambas as GPUs são detectadas: o `nvidia-smi` deve listar as duas placas com versões de driver compatíveis antes de tentar um split.
  • Comece com uma divisão igual: `--tensor-split 1,1` no llama.cpp é o padrão correto para duas placas idênticas.
  • Fique atento à saturação de largura de banda PCIe: se os tokens/seg estiverem bem abaixo do esperado, confirme se a placa-mãe está realmente rodando x8/x8 e não caindo silenciosamente para x4.

Caminho de Upgrade

O upgrade mais claro a partir deste build é adicionar uma terceira RTX 5060 Ti 16GB, caso a placa-mãe tenha um terceiro slot PCIe com largura de banda utilizável, elevando a VRAM combinada para 48GB — suficiente para quantizações maiores de modelos 70B ou folga confortável para janelas de contexto mais longas.

Um upgrade mais caro, porém mais simples, é substituir as duas placas RTX 5060 Ti por duas RTX 5070 Ti 16GB depois, mantendo o mesmo teto de 32GB de VRAM mas aumentando o poder de computação bruto e a largura de banda de memória, o que melhora os tokens/seg sem mudar quais tamanhos de modelo cabem.

Erros Comuns Nesse Orçamento

  • Comprar uma placa-mãe baseando-se apenas no selo "suporta SLI/CrossFire" — esse termo de marketing se refere à renderização multi-GPU para jogos, não à alocação de lanes PCIe para cargas de trabalho de computação, e não garante x8/x8.
  • Misturar gerações de GPU (por exemplo, uma RTX 5060 Ti + uma RTX 4060 Ti) para economizar dinheiro — o desempenho do tensor-split é limitado pela placa mais lenta/antiga, anulando a maior parte do benefício da mais nova.
  • Subestimar a margem da fonte — duas GPUs consumindo perto do TDP combinado simultaneamente durante uma geração longa podem ter picos breves bem acima de 360W; uma fonte subdimensionada causa desligamentos aleatórios sob carga, não uma desaceleração suave.
  • Assumir que o dobro de GPUs significa o dobro de tokens/seg — o tensor-split adiciona sobrecarga de transferência PCIe entre camadas, então o throughput combinado é significativamente menor do que 2x a velocidade de uma única placa em modelos que já cabiam em uma GPU.

Perguntas Frequentes

Um PC de $2.000 consegue rodar LLMs locais de 70B?

Sim, usando duas placas RTX 5060 Ti 16GB em uma configuração tensor-split, que combina 32GB de VRAM — suficiente para modelos 70B em quantização Q4, rodando a 12-18 tokens por segundo.

Por que usar duas GPUs de 16GB em vez de uma GPU de 24GB ou 32GB?

Duas GPUs de 16GB idênticas fornecem mais VRAM combinada por dólar do que uma única placa maior no mesmo orçamento, e o recurso tensor-split do llama.cpp permite que a VRAM de ambas as placas funcione como um único pool para inferência.

A placa-mãe importa para um build dual-GPU de LLM local?

Sim, significativamente. A placa precisa suportar alocação de lanes PCIe x8/x8 nos dois slots de GPU — uma placa que roda o segundo slot em x4 elétrico cria um gargalo real de largura de banda durante a inferência tensor-split, não apenas teórico.

Posso misturar modelos diferentes de GPU em um build dual-GPU?

Não é recomendado. O desempenho do tensor-split é limitado pela placa mais lenta ou mais antiga do par, e requisitos de driver incompatíveis entre gerações de GPU podem causar instabilidade. Use duas GPUs idênticas.

O Ollama ou o llama.cpp é melhor para inferência multi-GPU com tensor-split?

O Ollama detecta múltiplas GPUs automaticamente e não exige configuração manual, o que é mais simples para a maioria dos usuários. A flag manual --tensor-split do llama.cpp dá um controle mais preciso sobre a proporção do split, útil se uma GPU também estiver conectada a um monitor e precisar de menos VRAM reservada.

Quanto a largura de banda PCIe realmente afeta o desempenho do tensor-split?

Significativamente se o slot rodar em x4 em vez de x8. O PCIe 4.0 x8 já fornece mais largura de banda do que a inferência tensor-split normalmente precisa, mas x4 se torna um gargalo real já que ambas as GPUs transferem dados ativamente a cada forward pass.

Dobrar as GPUs dobra os tokens por segundo?

Não. O tensor-split adiciona sobrecarga de transferência PCIe entre as camadas divididas entre as placas, então o throughput combinado em um modelo que já cabe em uma GPU é significativamente menor do que 2x a velocidade dessa única placa. O benefício é caber modelos maiores, não escalar a velocidade linearmente.

Qual é o consumo total de energia de duas placas RTX 5060 Ti?

Aproximadamente 360W combinados em carga total (180W de TDP nominal cada), com picos transitórios breves acima disso. Uma fonte 850W 80+ Gold deixa margem confortável para o resto do sistema junto com esses picos.

Este build pode rodar modelos menores mais rápido usando apenas uma GPU?

Sim — para modelos que já cabem em 16GB (até 32B em Q4), rodar em uma única RTX 5060 Ti evita completamente a sobrecarga de PCIe do tensor-split e é mais rápido do que dividir um modelo que não precisava ser dividido.

Qual é o caminho de upgrade além deste build?

Adicionar uma terceira RTX 5060 Ti 16GB idêntica (se a placa-mãe tiver um terceiro slot PCIe utilizável) eleva a VRAM combinada para 48GB. Alternativamente, substituir as duas placas por unidades RTX 5070 Ti 16GB depois mantém o mesmo teto de 32GB mas aumenta o poder de computação e a largura de banda de memória.

Nota sobre informações de terceiros

Este artigo faz referência a modelos de IA, benchmarks, preços e licenças de terceiros. O cenário da IA muda rapidamente. Pontuações de benchmark, termos de licença, nomes de modelos e preços de API podem mudar entre o momento em que foi escrito e quando você está lendo. Antes de tomar decisões de implantação ou conformidade com base neste artigo, verifique os dados atuais na fonte oficial de cada fornecedor: fichas de modelos do Hugging Face para licenças e benchmarks, sites dos fornecedores para preços de API e EUR-Lex para o texto atual do GDPR e da Lei de IA da UE. Este artigo reflete informações publicamente disponíveis em maio de 2026.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Join the PromptQuorum Waitlist →

← Back to Local LLMs