Key Takeaways
- A RTX 3060 12GB vence para a maioria no Brasil: 12 GB de VRAM, R$ 1.450–2.000, ~36 tok/s no Llama 3.1 8B Q4, cadeia CUDA completa
- A Intel Arc B580 12GB (R$ 2.060–2.400) é a alternativa — arquitetura mais nova, mas no mercado brasileiro custa mais que a RTX 3060, ao contrário do que ocorre em dólar
- ⚠️ Alerta de preço: a RTX 4060 Ti 16GB, a vencedora anterior, passou de R$ 3.299 e no exterior está sem estoque ao preço de tabela — removida da lista sub-US$ 500
- ⚠️ Alerta de preço: a RTX 3090 de segunda mão está agora a partir de R$ 6.000 — removida da lista sub-US$ 500
- ⚠️ Alerta de preço: a RTX 4070 12GB está agora em ~R$ 3.500 — removida da lista sub-US$ 500
- ⚠️ Alerta de preço: a RX 7800 XT 16GB está agora em ~R$ 2.900 — removida da lista sub-US$ 500
- Por que tudo se moveu: uma escassez mundial de DRAM e GDDR7, puxada pela demanda dos data centers de IA, empurrou os preços de rua das placas bem acima do preço de tabela no mundo todo. O hardware não mudou; só o que ele custa. Precisa de capacidade para modelos 30B? Orçamento a partir de R$ 6.000 para uma RTX 3090 usada (24 GB).
- As três GPUs desta lista funcionam com Ollama, LM Studio e llama.cpp de fábrica
Melhores GPUs para inferência de LLM por menos de US$ 500 — Classificadas
A RTX 3060 12GB é a melhor GPU por menos de US$ 500 para inferência de LLM local no Brasil porque é a placa de 12 GB mais barata disponível localmente e traz a cadeia CUDA completa.
A VRAM da GPU determina quais modelos de IA você consegue rodar. Uma GPU de 16 GB roda modelos 14B em alta qualidade. Uma GPU de 24 GB (como uma RTX 3090 de segunda mão) roda modelos de 30B ou mais. Com menos de 12 GB você fica limitado a modelos 7B ou menores.
RTX 3060 12GB — Melhor opção geral no Brasil (R$ 1.450–2.000)
A NVIDIA GeForce RTX 3060 12GB é a melhor GPU por menos de US$ 500 para inferência de LLM local no Brasil. Seus 12 GB GDDR6 rodam modelos 7B–13B em Q4/Q8 com folga; não acomodam um 14B em Q8, mas um 14B em Q4 (~8,5 GB) cabe. Benchmark: ~32–40 tok/s no Llama 3.1 8B Q4 com Ollama. A cadeia CUDA completa significa que Ollama, LM Studio, vLLM e ajuste fino LoRA funcionam de fábrica no Windows e no Linux. Vale registrar uma diferença de mercado: no exterior a Intel Arc B580 é a placa de 12 GB mais barata e a RTX 3060 nova subiu para US$ 474–599, mas no Brasil a relação se inverte — a RTX 3060 continua sendo a entrada mais barata em 12 GB.
Intel Arc B580 12GB — Alternativa de arquitetura mais nova (R$ 2.060–2.400)
A Intel Arc B580 12GB foi lançada nos EUA a US$ 249 e é a queridinha do mercado em dólar, onde virou a placa de 12 GB mais barata depois que a escassez de memória de 2026 encareceu toda a linha NVIDIA. No Brasil a conta é outra: ela sai por R$ 2.060–2.400 em lojas como Terabyte, Pichau e Kabum, ou seja acima da RTX 3060 12GB. Roda o Ollama pelo backend SYCL/oneAPI no Linux e no Windows, com ~28–35 tok/s no Llama 3.1 8B Q4. O teto de 12 GB de VRAM limita a modelos 13B em Q4. O suporte de drivers da Intel melhorou muito desde o lançamento, mas ainda fica atrás do CUDA em amplitude de ferramentas: espere Ollama e llama.cpp funcionando bem e ajuste fino LoRA problemático.
RTX 4060 Ti 16GB — A melhor placa, se achar perto do preço de tabela (acima de R$ 3.299)
A RTX 4060 Ti 16GB continua sendo o melhor *hardware* desta lista e foi a vencedora desta página até a escassez de memória de 2026. Seus 16 GB GDDR6 rodam Qwen3 14B e Mistral 12B em Q4 totalmente na GPU — e em Q8 sem swap — a 45–60 tok/s em 7B Q4 e 18–25 tok/s em 14B Q8 com Ollama, com TDP de 165 W que qualquer fonte de 650 W aguenta. O problema é comprar uma. No exterior os anúncios ao preço de tabela de US$ 399 estão sem estoque e as unidades disponíveis giram perto de US$ 562, cerca de 41% acima da tabela; no Brasil ela passou de R$ 3.299. Se achar uma perto do preço de tabela é de longe a melhor compra desta página; nos preços atuais, está fora do orçamento para o qual ela foi escrita.
Comparação de desempenho — Preços atuais + resultados de testes
Benchmarks medidos com Ollama 0.30.x, servidor llama.cpp, modelos do HuggingFace. Sistema de teste: Ryzen 9 7950X, 64 GB DDR5, SSD NVMe. As velocidades não mudaram em relação aos testes anteriores: o hardware não se moveu, os preços sim. Excluídas por ultrapassarem a faixa: RTX 3090 usada (a partir de R$ 6.000), RTX 4070 12GB (~R$ 3.500), RX 7800 XT 16GB (~R$ 2.900) e RTX 4060 Ti 16GB (acima de R$ 3.299).
| GPU | VRAM | Preço | Llama 3.1 8B Q4 tok/s | Qwen3 14B Q8 tok/s | Modelo máximo (Q4) |
|---|---|---|---|---|---|
| RTX 3060 12GB ★ | 12 GB | R$ 1.450–2.000 | 36 tok/s | Limitado pela VRAM | 14B (Q4) |
| Intel Arc B580 12GB | 12 GB | R$ 2.060–2.400 | 31 tok/s | Limitado pela VRAM | 13B (Q4) |
| RTX 4060 Ti 16GB | 16 GB | acima de R$ 3.299 | 55 tok/s | 22 tok/s | 30B (Q4) |
Como selecionamos e testamos estas GPUs
Critérios de seleção: disponíveis para compra nova ou usada na faixa de US$ 500; compatíveis com pelo menos um runtime de inferência principal (Ollama, LM Studio, llama.cpp); VRAM ≥ 12 GB (placas de 8 GB excluídas). Várias placas saíram da lista por preço: a RTX 3090 usada (24 GB) parte de R$ 6.000; a RTX 4070 12GB está em ~R$ 3.500; a RX 7800 XT 16GB em ~R$ 2.900; e a RTX 4060 Ti 16GB passou de R$ 3.299, com os anúncios ao preço de tabela sem estoque no exterior. A causa é comum a todas: uma escassez mundial de DRAM e GDDR7 puxada pela demanda dos data centers de IA empurrou os preços de rua bem acima da tabela no mundo todo, com as RTX 50 da NVIDIA cerca de 36–39% acima do preço sugerido e a AMD elevando as Radeon em torno de 10%. Todos os benchmarks são tok/s, média de 10 execuções com batch size 1, medidos com Ollama 0.30.x no Ubuntu 22.04 LTS.
Requisitos de VRAM por tamanho de modelo
Requisitos de VRAM: o modelo 7B precisa de ~4–5 GB (Q4) ou ~7–8 GB (Q8); o modelo 14B precisa de ~8–9 GB (Q4) ou ~14–15 GB (Q8); o modelo 30B precisa de ~18–20 GB (Q4); o modelo 70B precisa de ~40–42 GB (Q4).
Pense na VRAM como a RAM para os modelos de IA. O modelo precisa caber inteiramente na VRAM para uma inferência rápida. Se transbordar para a RAM do sistema (chamado de "offloading"), a velocidade cai 80–95%. A quantização Q4 reduz o tamanho pela metade em relação ao Q8 com um pequeno custo em qualidade.
- Modelo 7B em Q4: ~4,5 GB de VRAM — qualquer GPU desta lista dá conta facilmente
- Modelo 7B em Q8: ~7,5 GB de VRAM — cabe em todas as GPUs aqui
- Modelo 13B em Q4: ~8,5 GB de VRAM — cabe em todas as GPUs desta lista
- Modelo 14B em Q8: ~14 GB de VRAM — só RTX 4060 Ti 16GB e RTX 3090 (usada)
- Modelo 30B em Q4: ~18 GB de VRAM — requer 24 GB (RTX 3090 de segunda mão, agora a partir de R$ 6.000)
- Modelo 70B em Q4: ~40 GB — exige duas GPUs ou offload para CPU
Qual GPU você deve comprar?
Use este guia de decisão conforme seu caso de uso principal:
- Melhor opção geral por menos de US$ 500 → RTX 3060 12GB (R$ 1.450–2.000). A entrada mais barata em 12 GB no Brasil, com a cadeia CUDA completa: Ollama, LM Studio, vLLM e ajuste fino LoRA.
- Alternativa de arquitetura mais nova → Intel Arc B580 12GB (R$ 2.060–2.400). Boa placa, mas no Brasil custa mais que a RTX 3060 — o inverso do mercado em dólar. Escolha-a se preferir arquitetura nova e não precisar de LoRA.
- Melhor hardware, se achar perto da tabela → RTX 4060 Ti 16GB. Roda 14B em Q8 na GPU e supera tudo aqui, mas passou de R$ 3.299 e está sem estoque ao preço de tabela no exterior.
- Precisa de capacidade para modelos 30B? → A janela sub-US$ 500 fechou em meados de 2026 e não reabriu. A RTX 3090 usada (24 GB) agora está a partir de R$ 6.000.
- Usuário de Windows, sem complicação → RTX 4060 Ti 16GB. A NVIDIA CUDA tem o suporte mais amplo no Windows para LLMs, fine-tuning e runtimes multimodais.
Compatibilidade de software por GPU
As três GPUs rodam Ollama e llama.cpp. As diferenças aparecem nas ferramentas avançadas:
| GPU | Ollama | LM Studio | vLLM | Text Gen WebUI | Fine-Tuning CUDA |
|---|---|---|---|---|---|
| RTX 3060 12GB | ✅ | ✅ | ✅ | ✅ | ✅ |
| Intel Arc B580 12GB | ✅ (SYCL) | ⚠️ beta | ❌ | ⚠️ parcial | ❌ |
| RTX 4060 Ti 16GB | ✅ | ✅ | ✅ | ✅ | ✅ |
Consumo de energia e requisitos do sistema
O consumo da GPU determina qual fonte de alimentação e gabinete você precisa. Rodar LLMs mantém as GPUs a 80–100% de utilização continuamente — diferente de jogos, não há frames ociosos.
- RTX 3060 12GB: 170 W — funciona com fonte de 550 W ou mais; um conector de 8 pinos
- Intel Arc B580 12GB: 190 W — fonte de 650 W ou mais; 8 pinos padrão
- RTX 4060 Ti 16GB: 165 W — funciona com fonte de 550 W ou mais; um conector de 8 pinos
8 GB de VRAM são suficientes para rodar LLMs localmente?
8 GB de VRAM limitam você a modelos 7B em quantização Q4 — o modelo mal cabe. Você não consegue rodar modelos 13B em qualidade completa, e os modelos 14B serão parcialmente descarregados para a RAM do sistema, reduzindo a velocidade em 80–95%. Para um uso local de LLM significativo em 2026, 12 GB é o mínimo prático; 16 GB é o recomendado.
Ainda posso comprar uma RTX 3090 de segunda mão por menos de US$ 500 em 2026?
Não. As RTX 3090 de segunda mão estão sendo negociadas a partir de R$ 6.000 no Mercado Livre. O preço subiu primeiro quando os entusiastas de LLM reconheceram o valor dos 24 GB de VRAM, e de novo durante a escassez de memória de 2026. Não é mais uma opção dentro da faixa, e já não é há um bom tempo. Se você precisa de capacidade para modelos 30B (que exige 24 GB de VRAM), reserve a partir de R$ 6.000 para uma RTX 3090 usada.
A AMD funciona para rodar LLMs localmente?
Sim, com ressalvas. O Ollama no Linux com ROCm funciona bem em placas como a RX 7800 XT. O suporte a ROCm no Windows melhorou, mas ainda exige passos manuais, e o fine-tuning (LoRA) em hardware AMD não é suportado pela maioria das ferramentas. Nota sobre preço: a RX 7800 XT 16GB subiu para ~R$ 2.900 em julho de 2026, então não cabe mais na faixa sub-US$ 500 — para essa faixa de preço, a RTX 4060 Ti 16GB ou a RTX 3060 12GB (ambas NVIDIA/CUDA) são as escolhas recomendadas. Para Windows ou fine-tuning, fique com a NVIDIA.
E as GPUs Intel Arc para IA?
A Intel Arc B580 12GB é a melhor opção Arc em 2026 e, no mercado em dólar, virou a melhor placa desta página depois que a escassez de memória reprecificou a linha NVIDIA. No Brasil, porém, ela sai por R$ 2.060–2.400, acima da RTX 3060 12GB, então aqui ela é alternativa e não a primeira escolha. Roda o Ollama no Windows e no Linux pelo backend SYCL, com desempenho 30–40% abaixo da NVIDIA em tok/s brutos. A limitação principal continua sendo software: vLLM, ferramentas de ajuste fino e runtimes multimodais ainda não dão bom suporte à Arc, então se você precisa de LoRA, fique com a RTX 3060 12GB.
Posso rodar um modelo 70B em uma única GPU por menos de US$ 500?
Não em velocidade plena. Mesmo a RTX 3090 (24 GB) não consegue armazenar 70B Q4 (~40 GB) inteiramente na VRAM. Você pode usar offload para CPU com o llama.cpp para dividir o modelo entre VRAM e RAM do sistema, mas a velocidade cai para 2–5 tok/s — lento demais para uso interativo. Para rodar modelos 70B em velocidades utilizáveis, você precisa de duas GPUs (2× RTX 3090 com 48 GB no total) ou inferência na nuvem.
As novas placas (RTX 5060 Ti) vão tornar essas GPUs obsoletas?
A RTX 5060 Ti 16GB já foi lançada, e não ficou abaixo da RTX 4060 Ti — foi o contrário. Saiu com preço de tabela de US$ 429 e hoje é vendida por US$ 570–600, cerca de 40% acima da tabela, porque a mesma escassez de memória que reprecificou toda esta lista bateu mais forte nela por ser placa de geração atual. É uma GPU genuinamente melhor que qualquer uma daqui, com 16 GB de VRAM e inferência mais rápida, mas não é uma placa dentro da faixa, e esperar que ela entre não é um plano que se sustente. Compre pelo que está disponível agora: no Brasil, a RTX 3060 12GB por R$ 1.450–2.000.
Quanto custa uma RTX 4060 Ti 16GB usada?
As RTX 4060 Ti 16GB usadas acompanharam a alta das novas: com as unidades novas passando de R$ 3.299, os anúncios de usadas ficam em torno de R$ 2.900–3.100 no Mercado Livre, dependendo do estado e da garantia restante. É uma das poucas placas em que comprar usada não representa grande economia, porque a oferta de unidades novas ao preço de tabela secou.
