Skip to main content
PromptQuorumPromptQuorum
Início/LLMs locais/Build de PC para LLM Local Por Menos de $1.000 (2026): Lista Completa de Peças e Desempenho
Hardware Setups

Build de PC para LLM Local Por Menos de $1.000 (2026): Lista Completa de Peças e Desempenho

·9 min de leitura·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

Um build de PC para LLM local de $1.000 gira em torno de uma peça: uma GPU com 16GB de VRAM. A RTX 5060 Ti 16GB ($430) combinada com um Ryzen 5 7600 ($180), 32GB de DDR5-6000 ($90), um SSD NVMe Gen4 de 1TB ($70), uma placa-mãe B650 mATX ($130), uma fonte 650W 80+ Gold ($75) e um gabinete mATX ($65) totaliza aproximadamente $1.010. Ele executa modelos de 7B a 55-65 tok/s, modelos de 14B a 28-35 tok/s, e modelos de 32B a uma velocidade apertada mas utilizável de 12-15 tok/s, tudo em quantização Q4.

Um PC de $1.000 com uma RTX 5060 Ti 16GB, um Ryzen 5 7600 e 32GB de RAM DDR5 executa todo modelo de 7B–14B em Q4 com folga e cabe modelos de 32B em uma quantização Q4 apertada. A VRAM é o único fator limitante para a inferência de LLM local, então este build gasta quase metade do orçamento ($430 de $1.000) na GPU em vez de dividir os fundos igualmente entre as peças. Este guia lista os componentes exatos, por que cada um foi escolhido em vez das alternativas, e as velocidades de tokens por segundo que você pode esperar em modelos reais.

Key Takeaways

  • Custo total do build: ~$1.010. RTX 5060 Ti 16GB ($430), Ryzen 5 7600 ($180), 32GB DDR5-6000 ($90), 1TB NVMe Gen4 ($70), placa-mãe B650 mATX ($130), fonte 650W 80+ Gold ($75), gabinete mATX ($65).
  • 16GB de VRAM é o alvo, não a velocidade bruta da GPU. A RTX 5060 Ti 16GB supera placas mais rápidas com 8-12GB de VRAM para trabalho de LLM porque o tamanho do modelo, não a contagem de shaders, decide o que cabe.
  • Modelos 7B: 55-65 tok/s em Q4. Modelos 14B: 28-35 tok/s. Modelos 32B cabem em Q4 com 1-2GB de margem restante para contexto, rodando a 12-15 tok/s.
  • Modelos 70B não cabem. Um modelo 70B em Q4 precisa de ~40GB de VRAM; este build atinge no máximo cerca de 32B. Veja o build dual-GPU de $2,000 para inferência de classe 70B.
  • 32GB de RAM do sistema, não 16GB. O carregamento do modelo, a sobrecarga do sistema operacional e quaisquer camadas transferidas para a CPU precisam de margem além da GPU; 16GB causa swapping em modelos 14B+.
  • Evite: GPUs de 8GB (RTX 5060, RTX 4060 Ti 8GB) — elas ficam limitadas a 7B e não conseguem crescer para 13B-14B sem uma troca completa de GPU.

O Que Este Orçamento Realmente Compra

A velocidade de inferência de LLM local é limitada primeiro pela capacidade de VRAM, segundo pela largura de banda de memória, e terceiro — bem atrás — pelo poder de computação (núcleos CUDA). Um modelo que não cabe na VRAM ou falha ao carregar ou transborda para a RAM do sistema, derrubando o throughput em 5-10x. Com $1.000, a única alocação correta é priorizar a GPU e economizar em tudo o resto — por isso a CPU aqui é uma peça intermediária de $180, e não um modelo topo de linha de $350.

Este build pressupõe inferência de modelo único (um modelo carregado por vez via Ollama, LM Studio ou llama.cpp), não atendimento concorrente multiusuário. Para atender múltiplas requisições simultâneas, os requisitos de VRAM aumentam ainda mais e um orçamento de $1.000 não é realista.

Um build de PC para LLM local de $1.000 deve gastar quase metade do orçamento na capacidade de VRAM da GPU, não na velocidade da CPU, já que a VRAM decide quais modelos conseguem rodar.

VRAM = a memória própria da GPU onde o modelo fica armazenado; se o modelo não couber, tudo fica 5-10x mais lento ou falha ao carregar.

Lista Completa de Peças

Os preços são preços de mercado em julho de 2026 e variam por região e revendedor.

ComponenteEscolhaPreçoPor Quê
GPURTX 5060 Ti 16GB$43016GB de VRAM é o propósito central do build — cabe 14B com folga, 32B em Q4
CPUAMD Ryzen 5 7600$1806 núcleos são suficientes para inferência de modelo único; a CPU não é o gargalo
RAM32GB DDR5-6000 (2x16GB)$90Margem para o sistema operacional, carregamento do modelo e quaisquer camadas transferidas para a CPU
Armazenamento1TB NVMe Gen4 SSD$70Tempos rápidos de carregamento de modelo; uma biblioteca de 5 modelos usa ~40-60GB em Q4
Placa-mãeB650 mATX$130Slot PCIe 4.0 x16, suporte a DDR5, sem recursos desnecessários
Fonte650W 80+ Gold$75A RTX 5060 Ti consome 180W; 650W deixa margem para picos transitórios
GabinetemATX mid-tower$65Fluxo de ar para carga de inferência sustentada; cabe qualquer comprimento de placa 5060 Ti
Cooler da CPUCooler original incluído$0O Ryzen 5 7600 não precisa de resfriamento aftermarket para essa carga de trabalho
Consumo estimado do sistema em comparação com a capacidade da fonte: o build de $1.000 com uma única GPU consome ~285W de uma fonte de 650W (56% de folga); o build de $2.000 com duas GPUs consome ~475W de uma fonte de 850W (44% de folga).
Consumo estimado do sistema em comparação com a capacidade da fonte: o build de $1.000 com uma única GPU consome ~285W de uma fonte de 650W (56% de folga); o build de $2.000 com duas GPUs consome ~475W de uma fonte de 850W (44% de folga).

Por Que a RTX 5060 Ti 16GB Em Vez de GPUs Mais Baratas

As variantes de 8GB e 12GB de GPUs com preço similar são uma falsa economia para trabalho de LLM local. A RTX 5060 Ti vem em versões de 8GB e 16GB com uma diferença de preço de aproximadamente $100 — a placa de 16GB é a única que vale a pena comprar para inferência de LLM, porque a versão de 8GB não consegue caber confortavelmente nada além de um modelo 7B em Q4 com qualquer comprimento de contexto utilizável.

A margem de VRAM também importa para o comprimento do contexto: um modelo 7B sozinho precisa de cerca de 4-4.5GB em Q4, mas um contexto de 16K tokens adiciona mais 1-2GB de cache KV. Em uma placa de 8GB isso deixa quase nada; na placa de 16GB há espaço tanto para o modelo quanto para uma janela de contexto longa.

  • RTX 5060 Ti 8GB ($330): Cabe apenas 7B em Q4, e por pouco — janelas de contexto longas vão estourar a VRAM. Não recomendado.
  • RTX 4060 Ti 16GB (geração anterior, ~$450 usada): Mesma VRAM da 5060 Ti a preço similar ou maior com menos poder de computação — nenhum motivo para preferi-la nova.
  • RTX 5060 Ti 16GB ($430, este build): Melhor VRAM por dólar na faixa de 16GB em julho de 2026.
  • RTX 3090 24GB usada (~$650-750): Mais VRAM (cabe modelos na faixa baixa de 30B com mais folga) mas empurra o custo total do build para além de $1.300 e consome significativamente mais energia.
VRAM necessária por tamanho de modelo na quantização Q4: 7B precisa de ~5GB, 14B ~9GB e 32B ~15GB — tudo cabe na placa de 16GB do build de $1.000. O 70B precisa de ~40GB, o que exige os 32GB de VRAM combinada das duas GPUs do build de $2.000.
VRAM necessária por tamanho de modelo na quantização Q4: 7B precisa de ~5GB, 14B ~9GB e 32B ~15GB — tudo cabe na placa de 16GB do build de $1.000. O 70B precisa de ~40GB, o que exige os 32GB de VRAM combinada das duas GPUs do build de $2.000.

Desempenho Esperado por Tamanho de Modelo

Todos os números são de quantização Q4_K_M, medidos com llama.cpp/Ollama na RTX 5060 Ti 16GB. A velocidade real varia de acordo com o comprimento do prompt, o método de quantização e o motor de inferência.

Tamanho do ModeloVRAM Usada (Q4)Tokens/segCabe Confortavelmente?
7B-8B~4.5-5GB55-65Sim — folga total de contexto
13B-14B~8-9GB28-35Sim — 8GB+ de margem para contexto
20B (MoE, ~4B ativos)~12GB35-45Sim
32B~14.5-15.5GB12-15Apertado — apenas contexto curto (4K-8K)
70B~40GBN/ANão cabe — veja o build dual-GPU de $2,000
Tokens/s por tamanho de modelo, quantização Q4: os dois builds empatam em 7B (~60 tok/s) e 14B (~31 tok/s), mas o build de $2.000 com duas GPUs se destaca no 32B via tensor-split (~34 contra ~13 tok/s) e é o único que roda o 70B (~15 tok/s).
Tokens/s por tamanho de modelo, quantização Q4: os dois builds empatam em 7B (~60 tok/s) e 14B (~31 tok/s), mas o build de $2.000 com duas GPUs se destaca no 32B via tensor-split (~34 contra ~13 tok/s) e é o único que roda o 70B (~15 tok/s).

Notas de Montagem

  • Espaço para a GPU: Confirme o comprimento da placa RTX 5060 Ti (varia de 210-270mm por fabricante) em relação ao espaço máximo para GPU do gabinete mATX antes de comprar.
  • Velocidade da RAM na BIOS: Kits DDR5-6000 costumam vir rodando em JEDEC 4800 por padrão — ative o EXPO/XMP na BIOS para obter a velocidade nominal de 6000, o que afeta a geração de tokens no lado da CPU caso alguma camada seja transferida.
  • Ordem de instalação dos drivers: Instale o driver mais recente da NVIDIA e o CUDA toolkit antes de instalar o Ollama ou o LM Studio, não depois — ambos detectam automaticamente a capacidade da GPU no momento da instalação.
  • Cabeamento da fonte: A RTX 5060 Ti usa um único conector de energia PCIe de 8 pinos (ou 12VHPWR em alguns modelos) — verifique se o kit de cabos modulares da sua fonte inclui o conector correto antes de montar.

Caminho de Upgrade

Este build foi projetado para que a GPU seja a única peça que vale a pena substituir depois. A placa-mãe B650 suporta um segundo slot PCIe (tipicamente x4 elétrico) para adicionar uma segunda GPU no futuro, embora a inferência multi-GPU com tensor-split precise de pelo menos x8/x8 para evitar um gargalo de largura de banda PCIe — veja o build de $2,000 para uma placa escolhida com isso em mente.

Um upgrade direto a partir deste build é trocar a RTX 5060 Ti 16GB por uma RTX 3090 24GB usada quando o orçamento permitir, o que libera inferência confortável em 32B e offloading leve de 70B. O Ryzen 5 7600, os 32GB de RAM e a fonte de 650W têm margem suficiente para suportar essa troca sem outras mudanças.

Erros Comuns Nesse Orçamento

  • Comprar a RTX 5060 Ti de 8GB para economizar $100 — o teto de VRAM que isso cria não pode ser corrigido por software e força uma troca de GPU depois, custando mais no total.
  • Gastar demais na CPU (por exemplo, um Ryzen 7 em vez de um Ryzen 5) enquanto usa uma GPU de 8GB ou 12GB — a escolha da CPU quase não afeta os tokens/seg quando um modelo já cabe na VRAM.
  • Pular a configuração do perfil EXPO/XMP da RAM na BIOS, deixando kits DDR5-6000 rodando a 4800 — uma perda de desempenho gratuita que não custa nada para corrigir.
  • Subdimensionar a fonte para economizar $20-30 — o consumo de energia da GPU tem picos breves bem acima do TDP nominal sob carga sustentada, e uma unidade de 550W deixa pouca margem.

Perguntas Frequentes

Um PC de $1.000 consegue rodar LLMs locais bem?

Sim, para modelos 7B-14B com folga e modelos 32B em uma quantização Q4 apertada. A RTX 5060 Ti 16GB, o componente central deste build, é o fator decisivo — a capacidade de VRAM importa muito mais do que o orçamento bruto além da GPU.

Por que este build gasta tanto na GPU em relação à CPU?

A velocidade de inferência de LLM local depende quase inteiramente da capacidade de VRAM e da largura de banda de memória da GPU. Uma CPU mais rápida não aumenta os tokens/seg depois que um modelo é carregado na VRAM, então uma CPU intermediária e uma GPU forte superam uma CPU forte e uma GPU fraca para essa carga de trabalho específica.

Os 16GB de VRAM são suficientes para LLMs locais em 2026?

16GB cabe confortavelmente todo modelo 7B-14B em Q4 com espaço para contexto longo, e cabe modelos 32B em Q4 com uma janela de contexto curta. Não cabe modelos de classe 70B, que precisam de aproximadamente 40GB em Q4.

Posso usar uma GPU de 8GB em vez dessa para economizar dinheiro?

Você pode, mas isso te limita a modelos 7B com pouquíssima margem de contexto — um teto rígido que você não consegue elevar sem trocar a placa. Os $100 economizados em uma RTX 5060 Ti de 8GB não valem a pena perder o acesso a modelos 13B-14B.

Quanta RAM eu realmente preciso junto com uma GPU de 16GB de VRAM?

32GB de RAM do sistema. Isso cobre a sobrecarga do sistema operacional, o cache de arquivos do modelo durante o carregamento, e quaisquer camadas transferidas para a CPU em modelos que excedem ligeiramente a capacidade da VRAM.

Este build vai rodar bem modelos 32B?

Ele cabe modelos 32B em quantização Q4 com aproximadamente 12-15 tokens por segundo, mas o comprimento do contexto é limitado a cerca de 4K-8K tokens já que sobra pouca margem de VRAM depois de carregar o modelo.

Qual software eu devo rodar neste build?

Ollama ou LM Studio são os pontos de partida mais simples — ambos detectam automaticamente a RTX 5060 Ti e lidam com a quantização Q4 automaticamente. O llama.cpp diretamente oferece mais controle sobre o formato de quantização e as configurações de contexto.

Este build pode ser atualizado para rodar modelos 70B depois?

Não com uma única GPU — 70B em Q4 precisa de ~40GB de VRAM. O caminho de upgrade mais claro é trocar para uma RTX 3090 24GB usada (ainda não o suficiente para 70B completo) ou adicionar uma segunda GPU para pooling de VRAM, o que o build dual-GPU de $2,000 cobre diretamente.

O chipset da placa-mãe (B650 vs B850) importa para a inferência de LLM local?

Não para um build de GPU única. O B650 fornece um slot PCIe 4.0 x16, que é o que a GPU precisa; as diferenças de chipset entre o B650 e placas mais novas importam mais para a alocação de lanes PCIe em multi-GPU do que para inferência de LLM com GPU única.

Uma GPU usada é um melhor custo-benefício do que uma RTX 5060 Ti 16GB nova nesse orçamento?

Uma RTX 3060 12GB usada pode ser mais barata, mas tem menos VRAM e menor largura de banda de memória, cabendo menos tamanhos de modelo. Uma RTX 3090 24GB usada é um upgrade genuíno de VRAM, mas empurra o custo total para além de $1.300 incluindo o resto do build — ela pertence a uma faixa de orçamento maior, não a esta.

Nota sobre informações de terceiros

Este artigo faz referência a modelos de IA, benchmarks, preços e licenças de terceiros. O cenário da IA muda rapidamente. Pontuações de benchmark, termos de licença, nomes de modelos e preços de API podem mudar entre o momento em que foi escrito e quando você está lendo. Antes de tomar decisões de implantação ou conformidade com base neste artigo, verifique os dados atuais na fonte oficial de cada fornecedor: fichas de modelos do Hugging Face para licenças e benchmarks, sites dos fornecedores para preços de API e EUR-Lex para o texto atual do GDPR e da Lei de IA da UE. Este artigo reflete informações publicamente disponíveis em maio de 2026.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Join the PromptQuorum Waitlist →

← Back to Local LLMs