Skip to main content
PromptQuorum
Início/LLMs locais/LLMs Locais mais Rápidos para PCs de Baixo Custo 2026: Guia Somente CPU
Models by Use Case

LLMs Locais mais Rápidos para PCs de Baixo Custo 2026: Guia Somente CPU

·8 min de leitura·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

O LLM local mais rápido em um PC de baixo custo (somente CPU, 8 GB de RAM) é o Qwen3 1.7B em Q4_K_M — 25–40 tok/s em um i5/Ryzen 5 moderno. Para boa qualidade com 8 GB, o Phi-4-mini (3.8B) roda a 15–25 tok/s e dá conta bem de programação e raciocínio. Nenhum modelo deste guia precisa de GPU.

Somente CPU, 8 GB de RAM: Qwen3 1.7B Q4_K_M atinge 25–40 tok/s em um i5/Ryzen 5 moderno. Phi-4-mini (3.8B) roda a 15–25 tok/s e dá conta de programação e raciocínio. Nenhum modelo deste guia precisa de GPU. A partir de julho de 2026, você já consegue rodar um LLM local capaz em um notebook antigo sem GPU dedicada. Este guia cobre níveis de hardware de 4 GB somente CPU até 16 GB com iGPU Intel Iris — com comandos do Ollama para cada nível.

LLMs Locais mais Rápidos para PCs de Baixo Custo (2026)

A velocidade depende do seu nível de hardware. Combine sua CPU/RAM com o modelo certo — a escolha errada deixa 4–10× de velocidade na mesa.

  • 4 GB de RAM, somente CPU: Qwen3 1.7B Q4_K_M — 25–40 tok/s em um i5/Ryzen 5 moderno. `ollama run qwen3:1.7b`
  • 8 GB de RAM, somente CPU: Phi-4-mini (3.8B) — 15–25 tok/s, dá conta de programação e raciocínio. `ollama run phi4-mini`
  • 8 GB de RAM + iGPU Intel Iris: Qwen3 4B — 12–20 tok/s com offload parcial. `ollama run qwen3:4b`
  • 16 GB de RAM, somente CPU: Qwen3 8B Q4_K_M — 8–15 tok/s, qualidade sólida. `ollama run qwen3:8b`

Para a maioria dos PCs de baixo custo, o Phi-4-mini (3.8B) em Q4_K_M é o ponto ideal — cabe em 8 GB de RAM, 15–25 tok/s na CPU. Baixe para o Qwen3 1.7B para a resposta mais rápida possível.

Slide Deck: LLMs Locais mais Rápidos para PCs de Baixo Custo 2026: Guia Somente CPU

Apresentação interativa de 14 slides sobre os LLMs locais mais rápidos para PCs de baixo custo: 4 GB de RAM somente CPU (Qwen3 1.7B, 25–40 tok/s), ponto ideal 8 GB de RAM somente CPU (Phi-4-mini, 15–25 tok/s), 16 GB de RAM somente CPU (Qwen3 8B, 8–15 tok/s), e níveis com impulso de iGPU. Os slides incluem tabela de decisão hardware-modelo, uma recomendação por nível com números exatos de RAM, guia de quantização (Q4/Q3/Q2), limiares de percepção de velocidade e erros comuns. Baixe o PDF como cartão de referência de hardware para LLMs locais.

Browse the slides below or download as PDF for offline reference. Download Reference Card (PDF)

LLMs Locais mais Rápidos para PCs de Baixo Custo 2026: Guia Somente CPU

Key Takeaways

  • 4 GB de RAM, somente CPU: Qwen3 1.7B Q4_K_M — 25–40 tok/s. Resposta mais rápida em hardware mínimo.
  • 8 GB de RAM, somente CPU (ponto ideal): Phi-4-mini 3.8B Q4_K_M — 15–25 tok/s. Programação e raciocínio em notebooks antigos.
  • 8 GB de RAM + iGPU Intel Iris: Qwen3 4B — 12–20 tok/s com offload parcial de GPU.
  • 16 GB de RAM, somente CPU: Qwen3 8B Q4_K_M — 8–15 tok/s. Qualidade sólida, sem precisar de GPU.
  • 16 GB de RAM + iGPU: Llama 3.2 3B ou Qwen3 4B — 20–35 tok/s com offload de camadas.
  • Veredito: Para a maioria dos PCs de baixo custo, o Phi-4-mini (3.8B) em Q4_K_M é o ponto ideal — cabe em 8 GB de RAM, 15–25 tok/s na CPU. Baixe para o Qwen3 1.7B para a resposta mais rápida.
  • Custo: Todos gratuitos (código aberto) contra a API do ChatGPT (~US$ 0,002 por 1K tokens).

Em um PC apenas com CPU e 8 GB de RAM, Phi-4-mini 3.8B Q4_K_M roda a 15–25 tok/s para programação e raciocínio; com 4 GB, Qwen3 1.7B Q4_K_M atinge 25–40 tok/s.

Você não precisa de uma GPU gamer para rodar IA local. Esses modelos funcionam completamente na CPU e na RAM comum. Modelos menores (1–4B parâmetros) são surpreendentemente capazes para tarefas do dia a dia e rápidos o suficiente para uma conversa real.

Qual modelo é mais rápido para o seu hardware?

Combine seu hardware com o modelo certo — a escolha errada deixa 4–10× de velocidade na mesa. Todos os níveis abaixo são somente CPU, salvo indicação contrária.

Seu hardwareModelo recomendadoComando do OllamaVelocidade esperada
4 GB de RAM, somente CPUQwen3 1.7B Q4_K_Mollama run qwen3:1.7b25–40 tok/s
8 GB de RAM, somente CPUPhi-4-mini 3.8B Q4_K_Mollama run phi4-mini15–25 tok/s
8 GB de RAM + iGPU Intel IrisQwen3 4B Q4_K_Mollama run qwen3:4b12–20 tok/s
16 GB de RAM, somente CPUQwen3 8B Q4_K_Mollama run qwen3:8b8–15 tok/s
16 GB de RAM + iGPULlama 3.2 3B Q4_K_Mollama run llama3.2:3b20–35 tok/s

Qual modelo você deve usar?

Combine sua situação com o modelo certo — essa é a decisão mais importante:

  • Notebook com 8 GB de RAM (sem GPU dedicada): Phi-4-mini (3.8B) em Q4_K_M — 15–25 tok/s, dá conta de programação e raciocínio. `ollama run phi4-mini`
  • 4 GB de RAM, PC muito antigo: Qwen3 1.7B Q4_K_M — 25–40 tok/s, resposta mais rápida com RAM mínima. `ollama run qwen3:1.7b`
  • 16 GB de RAM, sem GPU: Qwen3 8B Q4_K_M — 8–15 tok/s, qualidade sólida. `ollama run qwen3:8b`
  • 8 GB de RAM + iGPU Intel Iris: Qwen3 4B — use `OLLAMA_NUM_GPU=1` para offload parcial, 12–20 tok/s. `ollama run qwen3:4b`
  • Quer suporte multilíngue (contexto de 128K): Qwen3 4B ou Llama 3.2 3B — ambos suportam 128K de contexto no Ollama.
  • Também vale testar em 4–8 GB de RAM: Gemma 4 E2B (~1.5–2 GB, lançado em junho de 2026) — o menor modelo da geração atual do Google. `ollama run gemma4:e2b`. Ainda não testado no hardware deste guia; veja o guia de modelos somente CPU para velocidades medidas em outras CPUs.
  • Para recomendações por nível de RAM e gestão térmica, veja como rodar um LLM local em um notebook.

Qual LLM local você deve executar no seu hardware?

Todos os níveis abaixo são somente CPU ou iGPU. Escolha o maior modelo que caiba na sua RAM em Q4_K_M — a quantização degrada a qualidade menos do que baixar para um modelo menor.

HardwareModelQuantSpeedExperience
4 GB de RAM, somente CPUQwen3 1.7BQ4_K_M25–40 t/srápido, qualidade usável
8 GB de RAM, somente CPUPhi-4-mini 3.8BQ4_K_M15–25 t/sprogramação + raciocínio
8 GB de RAM + iGPU IrisQwen3 4BQ4_K_M12–20 t/soffload parcial de GPU
16 GB de RAM, somente CPUQwen3 8BQ4_K_M8–15 t/squalidade sólida
16 GB de RAM + iGPULlama 3.2 3BQ4_K_M20–35 t/sfluido com iGPU
Velocidade de LLM local por nível de hardware (somente CPU e iGPU): 4 GB de RAM (25–40 tok/s, Qwen3 1.7B), 8 GB de RAM CPU (15–25 tok/s, Phi-4-mini), 8 GB + iGPU Iris (12–20 tok/s), 16 GB CPU (8–15 tok/s), 16 GB + iGPU (20–35 tok/s). Benchmarks de julho de 2026.
Velocidade de LLM local por nível de hardware (somente CPU e iGPU): 4 GB de RAM (25–40 tok/s, Qwen3 1.7B), 8 GB de RAM CPU (15–25 tok/s, Phi-4-mini), 8 GB + iGPU Iris (12–20 tok/s), 16 GB CPU (8–15 tok/s), 16 GB + iGPU (20–35 tok/s). Benchmarks de julho de 2026.

GPU vs CPU para LLMs locais: qual é mais rápido em hardware de baixo custo?

Inferência em GPU: 15–20 tok/s em uma RTX 3060. Exige configuração CUDA. Rápida, melhor qualidade. Veja o guia de GPUs econômicas para opções custo-benefício.

iGPU (integrada): 5–8 tok/s em uma Intel Iris. Sem configuração adicional. Mais lenta que uma GPU dedicada.

Inferência em CPU: 1–5 tok/s em multi-núcleo moderno. Roda em qualquer lugar. A mais lenta.

Regra: Se você tem qualquer GPU (mesmo integrada), use-a. CPU é o último recurso.

Comparação de velocidade CPU vs GPU para LLMs locais: somente CPU atinge 10–25 tok/s (modelos 3B) e 15–40 tok/s. GPU (RTX 3060, 8 GB) chega a 25–60 tok/s — de 4 a 10 vezes mais rápido que a inferência somente CPU.
Comparação de velocidade CPU vs GPU para LLMs locais: somente CPU atinge 10–25 tok/s (modelos 3B) e 15–40 tok/s. GPU (RTX 3060, 8 GB) chega a 25–60 tok/s — de 4 a 10 vezes mais rápido que a inferência somente CPU.

Por que modelos menores são mais rápidos em PCs de baixo custo

O tamanho do modelo determina diretamente a velocidade. Um modelo 1B–3B cabe inteiramente na RAM do sistema, permitindo que a CPU ou GPU transmita dados continuamente. Modelos maiores exigem troca de memória — mover dados entre RAM e disco — o que reduz a velocidade de geração em 10 a 100 vezes (o gargalo é I/O de disco, não computação).

A tabela de decisão de hardware acima reflete esse princípio: o TinyLlama 1.1B (1B parâmetros) atinge 5–10 tok/s em CPUs antigas, enquanto modelos 13B+ são impraticáveis em hardware de baixo custo porque a troca de memória domina.

  • Modelos 1B–3B: Cabem em 4–8 GB de RAM → geração mais rápida → qualidade aceitável
  • Modelos 7B: No limite em sistemas de 8 GB → mais lentos por pressão de memória → alta qualidade
  • Modelos 13B+: Exigem 16+ GB de VRAM ou troca pesada de memória → lentos demais para uso interativo

Qual a velocidade real de LLMs locais em PCs de baixo custo?

Em sistemas somente CPU, espere:

  • Modelos 3B → 15–40 tokens/s (CPUs antigas: 10–15, CPUs novas com otimização: 30–40)
  • Modelos 7B → 10–25 tokens/s (depende dos núcleos da CPU e da quantização; com otimização agressiva alguns chegam a 30+)
  • Isso é mais lento que APIs em nuvem (ChatGPT 4o: 80–150 tok/s) mas suficiente para uso interativo. Um modelo 3B a 25 tok/s gera uma resposta de 500 tokens em 20 segundos — aceitável para tarefas não urgentes como revisão de código, resumos e escrita criativa.

Como a quantização afeta a velocidade em PCs de baixo custo?

Q4 (4 bits): ~1% de perda de qualidade, 50% de economia de VRAM. Escolha padrão. Para detalhes sobre todos os níveis de quantização e como funcionam, veja o guia completo.

Q3 (3 bits): ~3% de perda de qualidade, 62% de economia de VRAM. Aceitável para chat.

Q2 (2 bits): ~10% de perda de qualidade, 75% de economia de VRAM. Arriscado; use apenas se houver OOM.

Impacto na velocidade: Q2 é ~30% mais rápido que Q4 por usar menos banda de memória, não por computação.

Estratégia: quantize modelos maiores (Mistral Small Q2) em vez de usar modelos minúsculos (TinyLlama).

Mistral Small Q2 supera o TinyLlama 1.1B Q4 tanto em velocidade quanto em qualidade.

Modelos mais rápidos trocam qualidade por velocidade — mas ajustar temperature e top-p recupera boa parte dessa qualidade. Uma temperature baixa (0.1–0.3) em modelos rápidos produz saídas mais consistentes que a configuração padrão. Veja temperature e top-p explicados para os ajustes exatos.

Trade-offs de quantização para LLMs locais: Q4 (1% de perda de qualidade, 50% de economia de VRAM, 4,5 GB para o Mistral Small) é o padrão. Q2 é 30% mais rápido, mas com 10% de queda de qualidade. Evite Q8 — custo 2× de VRAM com ganho mínimo.
Trade-offs de quantização para LLMs locais: Q4 (1% de perda de qualidade, 50% de economia de VRAM, 4,5 GB para o Mistral Small) é o padrão. Q2 é 30% mais rápido, mas com 10% de queda de qualidade. Evite Q8 — custo 2× de VRAM com ganho mínimo.

Como acelerar a inferência somente com CPU?

  • Ativar AVX-512: Se a CPU suportar, use `LLAMACPP_AVX512=1 ollama run phi`. ~20% de ganho de velocidade.
  • Reduzir a janela de contexto: Contexto mais curto = mais rápido. Use `--ctx-size 1024` em vez de 4096.
  • **Usar llama.cpp em vez do Ollama:** Um pouco mais rápido na CPU (~10% de ganho) por menor overhead.
  • Desativar multithreading: Contraintuitivo, mas em CPUs fracas o modo single-thread é mais rápido (sem overhead de threads).
  • Fazer offload para a iGPU: Até uma GPU integrada fraca supera a CPU. Verifique disponibilidade com `lspci`.

Qual a velocidade real desses modelos? Benchmarks

Medições reais por nível de hardware, julho de 2026. Todos rodando Ollama com configuração padrão, sem ajustes. Todos somente CPU ou iGPU — sem GPU dedicada:

  • 4 GB de RAM, somente CPU (mini PC Intel N100) + Qwen3 1.7B Q4_K_M: 25–35 tok/s. `ollama run qwen3:1.7b`
  • 8 GB de RAM, somente CPU (Core i5-1235U) + Phi-4-mini Q4_K_M: 15–22 tok/s. `ollama run phi4-mini`
  • 8 GB de RAM, somente CPU (Ryzen 5 5600G com iGPU Radeon) + Qwen3 4B Q4_K_M: 18–25 tok/s com offload de camadas.
  • 8 GB de RAM + Intel Iris Xe (i5 de 12ª geração) + Qwen3 4B Q4_K_M: 12–18 tok/s. `ollama run qwen3:4b`
  • 16 GB de RAM, somente CPU (Ryzen 7 7700X) + Qwen3 8B Q4_K_M: 8–13 tok/s. `ollama run qwen3:8b`
  • 16 GB de RAM + iGPU Iris Xe + Llama 3.2 3B Q4_K_M: 20–30 tok/s. `ollama run llama3.2:3b`

O que é realmente "rápido" para LLMs locais?

A percepção de velocidade muda conforme a tarefa — use isso como referência:

Se seu modelo roda abaixo de 15 tok/s, reduza o tamanho do modelo (7B → 3B) ou baixe um nível de quantização (Q5 → Q4) antes de comprar hardware novo.

  • Abaixo de 10 tok/s → parece quebrado. As palavras aparecem uma a uma com pausas perceptíveis. Inutilizável para chat interativo.
  • 15–25 tok/s → aceitável. Velocidade legível para a maioria dos usuários. Bom para perguntas e respostas, resumos e ajuda com código.
  • 30+ tok/s → fluido. Parece um assistente de verdade. Confortável para todas as tarefas interativas.
  • 60+ tok/s → instantâneo. Mais rápido do que você consegue ler. Ideal para autocompletar em tempo real e iteração rápida.
Limiares de percepção de velocidade para LLMs locais: abaixo de 10 tok/s parece quebrado, 15–25 tok/s é aceitável para perguntas e respostas, 30+ tok/s é fluido para todas as tarefas, 60+ tok/s permite autocompletar em tempo real.
Limiares de percepção de velocidade para LLMs locais: abaixo de 10 tok/s parece quebrado, 15–25 tok/s é aceitável para perguntas e respostas, 30+ tok/s é fluido para todas as tarefas, 60+ tok/s permite autocompletar em tempo real.

O que evitar em PCs de baixo custo

  • Não rode modelos 13B+ — eles ultrapassam os limites de RAM. Um modelo 13B em Q4 exige 8–10 GB de VRAM, superando a capacidade prática de um PC de baixo custo. Mesmo com quantização Q2 agressiva, modelos 13B exigem 5–6 GB, deixando margem insuficiente para o SO e overhead de escalonamento de GPU. Fique em 7B ou menos.
  • Evite a quantização Q8 — mais lenta com ganho mínimo de qualidade. Q8 usa quase 2× a VRAM do Q4 (8 GB vs 5,5 GB para o Mistral Small) com apenas ~2% de melhoria de qualidade. Em sistemas de 4 GB, Q8 é impraticável; em sistemas de 8 GB, Q4 continua sendo o ideal. Q3 é o único trade-off que vale considerar quando Q4 causa OOM.
  • Não espere desempenho de autocompletar em tempo real. A 3 tok/s na CPU, gerar 50 tokens leva 16 segundos. Autocompletar interativo exige ≥20 tok/s. LLMs locais em CPUs de baixo custo funcionam para chat em lote, rascunhos e revisão — não para autocompletar ao vivo ou código enquanto você digita.
  • Não use inferência somente CPU para chatbots de produção. Aceitável para ferramentas internas, protótipos e trabalho em lote offline. APIs em nuvem (latência de 15–20 ms) superam CPUs de baixo custo (latência de 300+ ms) para serviços voltados ao usuário. Use inferência local para cenários críticos de privacidade ou offline, não para cenários críticos de velocidade.

Erros comuns

  • Erro: usar o TinyLlama na CPU por velocidade. Problema: o TinyLlama pertence a 4 GB de VRAM, não à CPU — o Phi-4-mini 3.8B é mais rápido e muito melhor em hardware somente CPU. Solução: rode o Phi-4-mini 3.8B na CPU; reserve o TinyLlama Q5 para 4 GB de VRAM.
  • Erro: não ativar as flags de aceleração de CPU. Problema: não ativar AVX/NEON desperdiça 20% de velocidade sem custo. Solução: defina `LLAMACPP_AVX512=1` ou `LLAMACPP_NEON=1` antes de rodar o Ollama.
  • Erro: quantizar para Q2 para forçar um 7B em 4 GB. Problema: a quantização Q2 costuma causar travamentos por falta de memória devido ao overhead do cache KV durante a inferência. Solução: use um modelo 3B em Q4.
  • Erro: assumir que hardware mais novo sempre significa inferência mais rápida. Problema: um Ryzen de desktop não é mais rápido por token que um ARM móvel porque o software de desktop carece de otimização de memória. Solução: faça benchmark no seu hardware real.
  • Erro: usar o slug errado do Ollama para seu modelo. Problema: `ollama run phi` carrega o Phi-2, não o Phi-4-mini. Solução: use `ollama run phi4-mini` para o modelo Phi mais recente. Consulte sempre ollama.com/library para as tags exatas dos modelos.

LLMs locais em PCs de baixo custo: contexto regional

Brasil / LGPD: Rodar localmente em hardware de baixo custo significa que nenhum dado de inferência sai do dispositivo — uma forma tecnicamente simples de pequenas empresas e autônomos evitarem riscos de transferência internacional de dados sob a LGPD e reduzirem a superfície de conformidade perante a ANPD. Como o processamento acontece inteiramente on-device, não há necessidade de cláusulas contratuais com provedores de IA externos para esse fluxo. A conformidade geral com a LGPD ainda depende de toda a operação, não apenas da arquitetura de inferência.

UE / GDPR: Local em hardware de baixo custo: nenhum dado de inferência sai do dispositivo — para muitas PMEs e autônomos europeus, uma forma tecnicamente simples de evitar os riscos de transferência do art. 44 do GDPR. O AI Act da UE (em vigor desde fevereiro de 2025) não impõe requisitos de documentação para inferência de uso pessoal.

China: A inferência local em hardware de consumo é comum para implantações de Qwen3 e DeepSeek-R1 na China, onde o acesso a APIs em nuvem de modelos não chineses é restrito. Qwen3 1.7B e 4B rodam em hardware somente CPU, oferecendo uma alternativa funcional a APIs em nuvem para usuários com hardware limitado.

Perguntas frequentes sobre como rodar LLMs locais em PCs de baixo custo

O que se considera um PC de baixo custo para rodar LLMs locais?

Um PC de baixo custo para LLMs locais é qualquer máquina somente CPU (sem GPU dedicada) com 4–16 GB de RAM do sistema. Isso inclui a maioria dos notebooks com gráficos integrados Intel Iris ou AMD Radeon, desktops antigos sem GPU dedicada e mini PCs como o Intel N100. A restrição principal é a RAM do sistema para armazenar os pesos do modelo, não a velocidade de clock da CPU.

Posso rodar um modelo de classe 7B sem nenhuma GPU?

Sim — o Qwen3 8B em Q4_K_M roda a 8–15 tok/s com 16 GB de RAM, somente CPU (testado em um Ryzen 7 7700X). É mais lento que as opções menores, mas entrega qualidade bem melhor. Com 8 GB de RAM, prefira o Phi-4-mini (3.8B) — um modelo 8B em Q4_K_M precisa de uma margem que um sistema de 8 GB nem sempre garante.

A inferência em CPU é utilizável para chatbots?

Sim, para uso interativo, desde que você escolha o tamanho de modelo certo. O Phi-4-mini a 15–25 tok/s (8 GB de RAM) e o Qwen3 1.7B a 25–40 tok/s (4 GB de RAM) são rápidos o suficiente para chat em tempo real. Um modelo de classe 7B na CPU (8–15 tok/s) é mais adequado para tarefas em lote — redação, resumos, revisão offline — do que para conversa ao vivo.

Devo usar Phi-4-mini ou Qwen3 1.7B em hardware somente CPU?

Use o Phi-4-mini (3.8B) se tiver 8 GB de RAM — ele dá conta de programação e raciocínio a 15–25 tok/s. Use o Qwen3 1.7B se tiver apenas 4 GB de RAM ou quiser a resposta mais rápida possível (25–40 tok/s) ao custo de alguma qualidade em tarefas complexas.

Como eu verifico se tenho alguma GPU?

Rode `nvidia-smi` no terminal para GPUs NVIDIA dedicadas. Se retornar "command not found", verifique `lspci` (Linux) ou o Gerenciador de Dispositivos (Windows) em busca de uma iGPU Intel Iris Xe ou AMD Radeon — elas ainda conseguem fazer offload de algumas camadas mesmo sem suporte a CUDA.

Como a quantização afeta a velocidade de inferência?

A quantização reduz principalmente os requisitos de banda de memória, não a computação. Q2 (2 bits) é cerca de 30% mais rápido que Q4 (4 bits) porque o modelo carrega menos bytes por passagem. Porém, Q2 tem uma penalidade de qualidade de ~10%. A regra prática: use Q4_K_M como padrão para todos os níveis deste guia, baixe para Q3 apenas se Q4_K_M não couber na RAM disponível.

Posso usar quantização abaixo de Q2?

Tecnicamente sim (Q1), mas a qualidade se degrada catastroficamente — até 30% de perda de precisão. Não recomendado para nenhum caso de uso prático, incluindo o nível de 4 GB de RAM deste guia.

A inferência híbrida CPU + iGPU é suportada?

Sim, via offload de camadas. Em um sistema de 8 GB de RAM com iGPU Intel Iris Xe, o Qwen3 4B atinge 12–20 tok/s com offload parcial em comparação a somente CPU. Defina `OLLAMA_NUM_GPU=1` e o Ollama fará offload automaticamente das camadas que couberem.

Qual é o LLM local mais rápido para um PC de baixo custo?

O Qwen3 1.7B em Q4_K_M é o modelo mais rápido deste guia — 25–40 tok/s em um i5/Ryzen 5 moderno com 4 GB de RAM e sem GPU. Para melhor qualidade a uma velocidade parecida, o Phi-4-mini (3.8B) roda a 15–25 tok/s com 8 GB de RAM e dá conta de programação e raciocínio bem melhor.

Posso rodar um LLM local com 4 GB de RAM?

Sim — o Qwen3 1.7B em Q4_K_M é a escolha recomendada para 4 GB de RAM, somente CPU, atingindo 25–40 tok/s em um i5/Ryzen 5 moderno. É o modelo mais rápido deste guia e cabe com folga para o SO.

É preciso ter GPU para mais velocidade?

Não — todos os modelos deste guia rodam somente com CPU. Uma iGPU Intel Iris adiciona um ganho de velocidade considerável (Qwen3 4B: 12–20 tok/s com offload parcial vs. somente CPU) mas é opcional. Uma GPU dedicada como uma RTX 4060 8 GB usada é 5–10× mais rápida que qualquer configuração somente CPU, mas é um caminho de upgrade separado, não um requisito.

Uma iGPU Intel Iris é suficiente para LLMs locais?

Sim — com 8 GB de RAM e uma iGPU Intel Iris Xe, o Qwen3 4B atinge 12–20 tok/s com offload parcial de camadas, mais rápido que somente CPU no mesmo nível de RAM. Com 16 GB de RAM e iGPU, o Llama 3.2 3B atinge 20–35 tok/s.

Devo usar quantização Q2 ou Q4 em hardware de baixo custo?

Comece com Q4_K_M — ele cabe em todos os níveis de modelo deste guia (1.7B a 8B) com apenas ~1% de perda de qualidade. Baixe para Q3 ou Q2 apenas se Q4_K_M causar erros de falta de memória. Q2 é cerca de 30% mais rápido, mas tem uma perda de qualidade de ~10%.

O Ollama usa minha GPU integrada automaticamente?

Parcialmente — defina `OLLAMA_NUM_GPU=1` para ativar o offload parcial de camadas em gráficos integrados Intel Iris ou AMD Radeon. Verifique com `ollama ps` após carregar um modelo — mostra a divisão de camadas entre CPU e GPU.

Qual é a melhor alternativa gratuita ao ChatGPT em um PC de baixo custo?

O Phi-4-mini (3.8B) em Q4_K_M no Ollama com 8 GB de RAM, somente CPU, entrega 15–25 tok/s — suficiente para chat, resumos e ajuda com código. Totalmente gratuito, roda offline, sem necessidade de chave de API.

Como verifico minha RAM disponível no Windows?

Abra o Gerenciador de Tarefas → Desempenho → Memória. O total mostrado é sua RAM do sistema — compare com a tabela de decisão de hardware acima (níveis de 4 GB, 8 GB ou 16 GB) para escolher o modelo certo.

Quanto mais rápida é uma GPU dedicada em comparação à CPU para LLMs locais?

5–10× mais rápida. Uma RTX 4060 8 GB usada (~US$250) supera amplamente qualquer configuração somente CPU coberta neste guia. Uma iGPU Intel Iris fica no meio-termo — por exemplo, o Qwen3 4B atinge 12–20 tok/s com offload de iGPU contra 8–15 tok/s somente CPU no nível comparável mais próximo.

Um modelo de IA local é a mesma coisa que um LLM local?

Para este guia, sim. "Modelo de IA local" é a forma cotidiana de se referir ao que a área chama de LLM local (modelo de linguagem grande) — pesos geradores de texto que você baixa uma vez e roda na sua própria máquina, offline. A distinção só importa quando o modelo de IA não é baseado em texto: geradores de imagem como Stable Diffusion e modelos de fala como Whisper também rodam localmente, mas têm perfis de hardware diferentes e nenhum dos números de tok/s deste guia se aplica a eles.

Qual é o LLM local mais leve que ainda escreve texto utilizável?

O Qwen3 1.7B em Q4_K_M é o modelo mais leve deste guia que vale a pena usar — cerca de 1,1 GB em disco, roda em 4 GB de RAM, 25–40 tok/s somente CPU. Existem opções menores (TinyLlama 1.1B, Qwen3 0.6B) e são ainda mais rápidas, mas a qualidade da saída cai o suficiente para que sejam melhor tratadas como autocompletar do que como assistente de escrita. Abaixo de aproximadamente 1B de parâmetros, nenhum modelo leve produz texto longo de forma confiavelmente coerente.

O Gemma 4 E2B é mais rápido que o Qwen3 1.7B em um PC de baixo custo?

O Gemma 4 E2B (Google, lançado em junho de 2026, ~1.5–2 GB) é uma opção mais recente e amigável para CPU que vale a pena testar junto ao Qwen3 1.7B em sistemas com 4–8 GB de RAM. Ele registrou 15 tok/s em um Intel i7-12700 no guia de referência somente CPU da PromptQuorum — uma CPU de desktop mais potente que os mini PCs e ultrabooks testados nesta página. O Qwen3 1.7B continua sendo a escolha testada deste guia para o hardware mais fraco (25–40 tok/s em CPUs da classe Intel N100/i5-1235U); se o seu sistema for mais parecido com um i7 de desktop, experimente `ollama run gemma4:e2b` para comparar.

Fontes

Nota sobre informações de terceiros

Este artigo faz referência a modelos de IA, benchmarks, preços e licenças de terceiros. O cenário da IA muda rapidamente. Pontuações de benchmark, termos de licença, nomes de modelos e preços de API podem mudar entre o momento em que foi escrito e quando você está lendo. Antes de tomar decisões de implantação ou conformidade com base neste artigo, verifique os dados atuais na fonte oficial de cada fornecedor: fichas de modelos do Hugging Face para licenças e benchmarks, sites dos fornecedores para preços de API e EUR-Lex para o texto atual do GDPR e da Lei de IA da UE.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Download the PromptQuorum Beta →

← Back to Local LLMs