Key Takeaways
- 4 GB de RAM, somente CPU: Qwen3 1.7B Q4_K_M — 25–40 tok/s. Resposta mais rápida em hardware mínimo.
- 8 GB de RAM, somente CPU (ponto ideal): Phi-4-mini 3.8B Q4_K_M — 15–25 tok/s. Programação e raciocínio em notebooks antigos.
- 8 GB de RAM + iGPU Intel Iris: Qwen3 4B — 12–20 tok/s com offload parcial de GPU.
- 16 GB de RAM, somente CPU: Qwen3 8B Q4_K_M — 8–15 tok/s. Qualidade sólida, sem precisar de GPU.
- 16 GB de RAM + iGPU: Llama 3.2 3B ou Qwen3 4B — 20–35 tok/s com offload de camadas.
- Veredito: Para a maioria dos PCs de baixo custo, o Phi-4-mini (3.8B) em Q4_K_M é o ponto ideal — cabe em 8 GB de RAM, 15–25 tok/s na CPU. Baixe para o Qwen3 1.7B para a resposta mais rápida.
- Custo: Todos gratuitos (código aberto) contra a API do ChatGPT (~US$ 0,002 por 1K tokens).
Em um PC apenas com CPU e 8 GB de RAM, Phi-4-mini 3.8B Q4_K_M roda a 15–25 tok/s para programação e raciocínio; com 4 GB, Qwen3 1.7B Q4_K_M atinge 25–40 tok/s.
Você não precisa de uma GPU gamer para rodar IA local. Esses modelos funcionam completamente na CPU e na RAM comum. Modelos menores (1–4B parâmetros) são surpreendentemente capazes para tarefas do dia a dia e rápidos o suficiente para uma conversa real.
Qual modelo é mais rápido para o seu hardware?
Combine seu hardware com o modelo certo — a escolha errada deixa 4–10× de velocidade na mesa. Todos os níveis abaixo são somente CPU, salvo indicação contrária.
| Seu hardware | Modelo recomendado | Comando do Ollama | Velocidade esperada |
|---|---|---|---|
| 4 GB de RAM, somente CPU | Qwen3 1.7B Q4_K_M | ollama run qwen3:1.7b | 25–40 tok/s |
| 8 GB de RAM, somente CPU | Phi-4-mini 3.8B Q4_K_M | ollama run phi4-mini | 15–25 tok/s |
| 8 GB de RAM + iGPU Intel Iris | Qwen3 4B Q4_K_M | ollama run qwen3:4b | 12–20 tok/s |
| 16 GB de RAM, somente CPU | Qwen3 8B Q4_K_M | ollama run qwen3:8b | 8–15 tok/s |
| 16 GB de RAM + iGPU | Llama 3.2 3B Q4_K_M | ollama run llama3.2:3b | 20–35 tok/s |
Qual modelo você deve usar?
Combine sua situação com o modelo certo — essa é a decisão mais importante:
- Notebook com 8 GB de RAM (sem GPU dedicada): Phi-4-mini (3.8B) em Q4_K_M — 15–25 tok/s, dá conta de programação e raciocínio. `ollama run phi4-mini`
- 4 GB de RAM, PC muito antigo: Qwen3 1.7B Q4_K_M — 25–40 tok/s, resposta mais rápida com RAM mínima. `ollama run qwen3:1.7b`
- 16 GB de RAM, sem GPU: Qwen3 8B Q4_K_M — 8–15 tok/s, qualidade sólida. `ollama run qwen3:8b`
- 8 GB de RAM + iGPU Intel Iris: Qwen3 4B — use `OLLAMA_NUM_GPU=1` para offload parcial, 12–20 tok/s. `ollama run qwen3:4b`
- Quer suporte multilíngue (contexto de 128K): Qwen3 4B ou Llama 3.2 3B — ambos suportam 128K de contexto no Ollama.
- Também vale testar em 4–8 GB de RAM: Gemma 4 E2B (~1.5–2 GB, lançado em junho de 2026) — o menor modelo da geração atual do Google. `ollama run gemma4:e2b`. Ainda não testado no hardware deste guia; veja o guia de modelos somente CPU para velocidades medidas em outras CPUs.
- Para recomendações por nível de RAM e gestão térmica, veja como rodar um LLM local em um notebook.
Qual LLM local você deve executar no seu hardware?
Todos os níveis abaixo são somente CPU ou iGPU. Escolha o maior modelo que caiba na sua RAM em Q4_K_M — a quantização degrada a qualidade menos do que baixar para um modelo menor.
| Hardware | Model | Quant | Speed | Experience |
|---|---|---|---|---|
| 4 GB de RAM, somente CPU | Qwen3 1.7B | Q4_K_M | 25–40 t/s | rápido, qualidade usável |
| 8 GB de RAM, somente CPU | Phi-4-mini 3.8B | Q4_K_M | 15–25 t/s | programação + raciocínio |
| 8 GB de RAM + iGPU Iris | Qwen3 4B | Q4_K_M | 12–20 t/s | offload parcial de GPU |
| 16 GB de RAM, somente CPU | Qwen3 8B | Q4_K_M | 8–15 t/s | qualidade sólida |
| 16 GB de RAM + iGPU | Llama 3.2 3B | Q4_K_M | 20–35 t/s | fluido com iGPU |

GPU vs CPU para LLMs locais: qual é mais rápido em hardware de baixo custo?
Inferência em GPU: 15–20 tok/s em uma RTX 3060. Exige configuração CUDA. Rápida, melhor qualidade. Veja o guia de GPUs econômicas para opções custo-benefício.
iGPU (integrada): 5–8 tok/s em uma Intel Iris. Sem configuração adicional. Mais lenta que uma GPU dedicada.
Inferência em CPU: 1–5 tok/s em multi-núcleo moderno. Roda em qualquer lugar. A mais lenta.
Regra: Se você tem qualquer GPU (mesmo integrada), use-a. CPU é o último recurso.

Por que modelos menores são mais rápidos em PCs de baixo custo
O tamanho do modelo determina diretamente a velocidade. Um modelo 1B–3B cabe inteiramente na RAM do sistema, permitindo que a CPU ou GPU transmita dados continuamente. Modelos maiores exigem troca de memória — mover dados entre RAM e disco — o que reduz a velocidade de geração em 10 a 100 vezes (o gargalo é I/O de disco, não computação).
A tabela de decisão de hardware acima reflete esse princípio: o TinyLlama 1.1B (1B parâmetros) atinge 5–10 tok/s em CPUs antigas, enquanto modelos 13B+ são impraticáveis em hardware de baixo custo porque a troca de memória domina.
- Modelos 1B–3B: Cabem em 4–8 GB de RAM → geração mais rápida → qualidade aceitável
- Modelos 7B: No limite em sistemas de 8 GB → mais lentos por pressão de memória → alta qualidade
- Modelos 13B+: Exigem 16+ GB de VRAM ou troca pesada de memória → lentos demais para uso interativo
Qual a velocidade real de LLMs locais em PCs de baixo custo?
Em sistemas somente CPU, espere:
- Modelos 3B → 15–40 tokens/s (CPUs antigas: 10–15, CPUs novas com otimização: 30–40)
- Modelos 7B → 10–25 tokens/s (depende dos núcleos da CPU e da quantização; com otimização agressiva alguns chegam a 30+)
- Isso é mais lento que APIs em nuvem (ChatGPT 4o: 80–150 tok/s) mas suficiente para uso interativo. Um modelo 3B a 25 tok/s gera uma resposta de 500 tokens em 20 segundos — aceitável para tarefas não urgentes como revisão de código, resumos e escrita criativa.
Como a quantização afeta a velocidade em PCs de baixo custo?
Q4 (4 bits): ~1% de perda de qualidade, 50% de economia de VRAM. Escolha padrão. Para detalhes sobre todos os níveis de quantização e como funcionam, veja o guia completo.
Q3 (3 bits): ~3% de perda de qualidade, 62% de economia de VRAM. Aceitável para chat.
Q2 (2 bits): ~10% de perda de qualidade, 75% de economia de VRAM. Arriscado; use apenas se houver OOM.
Impacto na velocidade: Q2 é ~30% mais rápido que Q4 por usar menos banda de memória, não por computação.
Estratégia: quantize modelos maiores (Mistral Small Q2) em vez de usar modelos minúsculos (TinyLlama).
Mistral Small Q2 supera o TinyLlama 1.1B Q4 tanto em velocidade quanto em qualidade.
Modelos mais rápidos trocam qualidade por velocidade — mas ajustar temperature e top-p recupera boa parte dessa qualidade. Uma temperature baixa (0.1–0.3) em modelos rápidos produz saídas mais consistentes que a configuração padrão. Veja temperature e top-p explicados para os ajustes exatos.
Como acelerar a inferência somente com CPU?
- Ativar AVX-512: Se a CPU suportar, use `LLAMACPP_AVX512=1 ollama run phi`. ~20% de ganho de velocidade.
- Reduzir a janela de contexto: Contexto mais curto = mais rápido. Use `--ctx-size 1024` em vez de 4096.
- **Usar llama.cpp em vez do Ollama:** Um pouco mais rápido na CPU (~10% de ganho) por menor overhead.
- Desativar multithreading: Contraintuitivo, mas em CPUs fracas o modo single-thread é mais rápido (sem overhead de threads).
- Fazer offload para a iGPU: Até uma GPU integrada fraca supera a CPU. Verifique disponibilidade com `lspci`.
Qual a velocidade real desses modelos? Benchmarks
Medições reais por nível de hardware, julho de 2026. Todos rodando Ollama com configuração padrão, sem ajustes. Todos somente CPU ou iGPU — sem GPU dedicada:
- 4 GB de RAM, somente CPU (mini PC Intel N100) + Qwen3 1.7B Q4_K_M: 25–35 tok/s. `ollama run qwen3:1.7b`
- 8 GB de RAM, somente CPU (Core i5-1235U) + Phi-4-mini Q4_K_M: 15–22 tok/s. `ollama run phi4-mini`
- 8 GB de RAM, somente CPU (Ryzen 5 5600G com iGPU Radeon) + Qwen3 4B Q4_K_M: 18–25 tok/s com offload de camadas.
- 8 GB de RAM + Intel Iris Xe (i5 de 12ª geração) + Qwen3 4B Q4_K_M: 12–18 tok/s. `ollama run qwen3:4b`
- 16 GB de RAM, somente CPU (Ryzen 7 7700X) + Qwen3 8B Q4_K_M: 8–13 tok/s. `ollama run qwen3:8b`
- 16 GB de RAM + iGPU Iris Xe + Llama 3.2 3B Q4_K_M: 20–30 tok/s. `ollama run llama3.2:3b`
O que é realmente "rápido" para LLMs locais?
A percepção de velocidade muda conforme a tarefa — use isso como referência:
Se seu modelo roda abaixo de 15 tok/s, reduza o tamanho do modelo (7B → 3B) ou baixe um nível de quantização (Q5 → Q4) antes de comprar hardware novo.
- Abaixo de 10 tok/s → parece quebrado. As palavras aparecem uma a uma com pausas perceptíveis. Inutilizável para chat interativo.
- 15–25 tok/s → aceitável. Velocidade legível para a maioria dos usuários. Bom para perguntas e respostas, resumos e ajuda com código.
- 30+ tok/s → fluido. Parece um assistente de verdade. Confortável para todas as tarefas interativas.
- 60+ tok/s → instantâneo. Mais rápido do que você consegue ler. Ideal para autocompletar em tempo real e iteração rápida.
O que evitar em PCs de baixo custo
- Não rode modelos 13B+ — eles ultrapassam os limites de RAM. Um modelo 13B em Q4 exige 8–10 GB de VRAM, superando a capacidade prática de um PC de baixo custo. Mesmo com quantização Q2 agressiva, modelos 13B exigem 5–6 GB, deixando margem insuficiente para o SO e overhead de escalonamento de GPU. Fique em 7B ou menos.
- Evite a quantização Q8 — mais lenta com ganho mínimo de qualidade. Q8 usa quase 2× a VRAM do Q4 (8 GB vs 5,5 GB para o Mistral Small) com apenas ~2% de melhoria de qualidade. Em sistemas de 4 GB, Q8 é impraticável; em sistemas de 8 GB, Q4 continua sendo o ideal. Q3 é o único trade-off que vale considerar quando Q4 causa OOM.
- Não espere desempenho de autocompletar em tempo real. A 3 tok/s na CPU, gerar 50 tokens leva 16 segundos. Autocompletar interativo exige ≥20 tok/s. LLMs locais em CPUs de baixo custo funcionam para chat em lote, rascunhos e revisão — não para autocompletar ao vivo ou código enquanto você digita.
- Não use inferência somente CPU para chatbots de produção. Aceitável para ferramentas internas, protótipos e trabalho em lote offline. APIs em nuvem (latência de 15–20 ms) superam CPUs de baixo custo (latência de 300+ ms) para serviços voltados ao usuário. Use inferência local para cenários críticos de privacidade ou offline, não para cenários críticos de velocidade.
Erros comuns
- Erro: usar o TinyLlama na CPU por velocidade. Problema: o TinyLlama pertence a 4 GB de VRAM, não à CPU — o Phi-4-mini 3.8B é mais rápido e muito melhor em hardware somente CPU. Solução: rode o Phi-4-mini 3.8B na CPU; reserve o TinyLlama Q5 para 4 GB de VRAM.
- Erro: não ativar as flags de aceleração de CPU. Problema: não ativar AVX/NEON desperdiça 20% de velocidade sem custo. Solução: defina `LLAMACPP_AVX512=1` ou `LLAMACPP_NEON=1` antes de rodar o Ollama.
- Erro: quantizar para Q2 para forçar um 7B em 4 GB. Problema: a quantização Q2 costuma causar travamentos por falta de memória devido ao overhead do cache KV durante a inferência. Solução: use um modelo 3B em Q4.
- Erro: assumir que hardware mais novo sempre significa inferência mais rápida. Problema: um Ryzen de desktop não é mais rápido por token que um ARM móvel porque o software de desktop carece de otimização de memória. Solução: faça benchmark no seu hardware real.
- Erro: usar o slug errado do Ollama para seu modelo. Problema: `ollama run phi` carrega o Phi-2, não o Phi-4-mini. Solução: use `ollama run phi4-mini` para o modelo Phi mais recente. Consulte sempre ollama.com/library para as tags exatas dos modelos.
LLMs locais em PCs de baixo custo: contexto regional
Brasil / LGPD: Rodar localmente em hardware de baixo custo significa que nenhum dado de inferência sai do dispositivo — uma forma tecnicamente simples de pequenas empresas e autônomos evitarem riscos de transferência internacional de dados sob a LGPD e reduzirem a superfície de conformidade perante a ANPD. Como o processamento acontece inteiramente on-device, não há necessidade de cláusulas contratuais com provedores de IA externos para esse fluxo. A conformidade geral com a LGPD ainda depende de toda a operação, não apenas da arquitetura de inferência.
UE / GDPR: Local em hardware de baixo custo: nenhum dado de inferência sai do dispositivo — para muitas PMEs e autônomos europeus, uma forma tecnicamente simples de evitar os riscos de transferência do art. 44 do GDPR. O AI Act da UE (em vigor desde fevereiro de 2025) não impõe requisitos de documentação para inferência de uso pessoal.
China: A inferência local em hardware de consumo é comum para implantações de Qwen3 e DeepSeek-R1 na China, onde o acesso a APIs em nuvem de modelos não chineses é restrito. Qwen3 1.7B e 4B rodam em hardware somente CPU, oferecendo uma alternativa funcional a APIs em nuvem para usuários com hardware limitado.
Perguntas frequentes sobre como rodar LLMs locais em PCs de baixo custo
O que se considera um PC de baixo custo para rodar LLMs locais?
Um PC de baixo custo para LLMs locais é qualquer máquina somente CPU (sem GPU dedicada) com 4–16 GB de RAM do sistema. Isso inclui a maioria dos notebooks com gráficos integrados Intel Iris ou AMD Radeon, desktops antigos sem GPU dedicada e mini PCs como o Intel N100. A restrição principal é a RAM do sistema para armazenar os pesos do modelo, não a velocidade de clock da CPU.
Posso rodar um modelo de classe 7B sem nenhuma GPU?
Sim — o Qwen3 8B em Q4_K_M roda a 8–15 tok/s com 16 GB de RAM, somente CPU (testado em um Ryzen 7 7700X). É mais lento que as opções menores, mas entrega qualidade bem melhor. Com 8 GB de RAM, prefira o Phi-4-mini (3.8B) — um modelo 8B em Q4_K_M precisa de uma margem que um sistema de 8 GB nem sempre garante.
A inferência em CPU é utilizável para chatbots?
Sim, para uso interativo, desde que você escolha o tamanho de modelo certo. O Phi-4-mini a 15–25 tok/s (8 GB de RAM) e o Qwen3 1.7B a 25–40 tok/s (4 GB de RAM) são rápidos o suficiente para chat em tempo real. Um modelo de classe 7B na CPU (8–15 tok/s) é mais adequado para tarefas em lote — redação, resumos, revisão offline — do que para conversa ao vivo.
Devo usar Phi-4-mini ou Qwen3 1.7B em hardware somente CPU?
Use o Phi-4-mini (3.8B) se tiver 8 GB de RAM — ele dá conta de programação e raciocínio a 15–25 tok/s. Use o Qwen3 1.7B se tiver apenas 4 GB de RAM ou quiser a resposta mais rápida possível (25–40 tok/s) ao custo de alguma qualidade em tarefas complexas.
Como eu verifico se tenho alguma GPU?
Rode `nvidia-smi` no terminal para GPUs NVIDIA dedicadas. Se retornar "command not found", verifique `lspci` (Linux) ou o Gerenciador de Dispositivos (Windows) em busca de uma iGPU Intel Iris Xe ou AMD Radeon — elas ainda conseguem fazer offload de algumas camadas mesmo sem suporte a CUDA.
Como a quantização afeta a velocidade de inferência?
A quantização reduz principalmente os requisitos de banda de memória, não a computação. Q2 (2 bits) é cerca de 30% mais rápido que Q4 (4 bits) porque o modelo carrega menos bytes por passagem. Porém, Q2 tem uma penalidade de qualidade de ~10%. A regra prática: use Q4_K_M como padrão para todos os níveis deste guia, baixe para Q3 apenas se Q4_K_M não couber na RAM disponível.
Posso usar quantização abaixo de Q2?
Tecnicamente sim (Q1), mas a qualidade se degrada catastroficamente — até 30% de perda de precisão. Não recomendado para nenhum caso de uso prático, incluindo o nível de 4 GB de RAM deste guia.
A inferência híbrida CPU + iGPU é suportada?
Sim, via offload de camadas. Em um sistema de 8 GB de RAM com iGPU Intel Iris Xe, o Qwen3 4B atinge 12–20 tok/s com offload parcial em comparação a somente CPU. Defina `OLLAMA_NUM_GPU=1` e o Ollama fará offload automaticamente das camadas que couberem.
Qual é o LLM local mais rápido para um PC de baixo custo?
O Qwen3 1.7B em Q4_K_M é o modelo mais rápido deste guia — 25–40 tok/s em um i5/Ryzen 5 moderno com 4 GB de RAM e sem GPU. Para melhor qualidade a uma velocidade parecida, o Phi-4-mini (3.8B) roda a 15–25 tok/s com 8 GB de RAM e dá conta de programação e raciocínio bem melhor.
Posso rodar um LLM local com 4 GB de RAM?
Sim — o Qwen3 1.7B em Q4_K_M é a escolha recomendada para 4 GB de RAM, somente CPU, atingindo 25–40 tok/s em um i5/Ryzen 5 moderno. É o modelo mais rápido deste guia e cabe com folga para o SO.
É preciso ter GPU para mais velocidade?
Não — todos os modelos deste guia rodam somente com CPU. Uma iGPU Intel Iris adiciona um ganho de velocidade considerável (Qwen3 4B: 12–20 tok/s com offload parcial vs. somente CPU) mas é opcional. Uma GPU dedicada como uma RTX 4060 8 GB usada é 5–10× mais rápida que qualquer configuração somente CPU, mas é um caminho de upgrade separado, não um requisito.
Uma iGPU Intel Iris é suficiente para LLMs locais?
Sim — com 8 GB de RAM e uma iGPU Intel Iris Xe, o Qwen3 4B atinge 12–20 tok/s com offload parcial de camadas, mais rápido que somente CPU no mesmo nível de RAM. Com 16 GB de RAM e iGPU, o Llama 3.2 3B atinge 20–35 tok/s.
Devo usar quantização Q2 ou Q4 em hardware de baixo custo?
Comece com Q4_K_M — ele cabe em todos os níveis de modelo deste guia (1.7B a 8B) com apenas ~1% de perda de qualidade. Baixe para Q3 ou Q2 apenas se Q4_K_M causar erros de falta de memória. Q2 é cerca de 30% mais rápido, mas tem uma perda de qualidade de ~10%.
O Ollama usa minha GPU integrada automaticamente?
Parcialmente — defina `OLLAMA_NUM_GPU=1` para ativar o offload parcial de camadas em gráficos integrados Intel Iris ou AMD Radeon. Verifique com `ollama ps` após carregar um modelo — mostra a divisão de camadas entre CPU e GPU.
Qual é a melhor alternativa gratuita ao ChatGPT em um PC de baixo custo?
O Phi-4-mini (3.8B) em Q4_K_M no Ollama com 8 GB de RAM, somente CPU, entrega 15–25 tok/s — suficiente para chat, resumos e ajuda com código. Totalmente gratuito, roda offline, sem necessidade de chave de API.
Como verifico minha RAM disponível no Windows?
Abra o Gerenciador de Tarefas → Desempenho → Memória. O total mostrado é sua RAM do sistema — compare com a tabela de decisão de hardware acima (níveis de 4 GB, 8 GB ou 16 GB) para escolher o modelo certo.
Quanto mais rápida é uma GPU dedicada em comparação à CPU para LLMs locais?
5–10× mais rápida. Uma RTX 4060 8 GB usada (~US$250) supera amplamente qualquer configuração somente CPU coberta neste guia. Uma iGPU Intel Iris fica no meio-termo — por exemplo, o Qwen3 4B atinge 12–20 tok/s com offload de iGPU contra 8–15 tok/s somente CPU no nível comparável mais próximo.
Um modelo de IA local é a mesma coisa que um LLM local?
Para este guia, sim. "Modelo de IA local" é a forma cotidiana de se referir ao que a área chama de LLM local (modelo de linguagem grande) — pesos geradores de texto que você baixa uma vez e roda na sua própria máquina, offline. A distinção só importa quando o modelo de IA não é baseado em texto: geradores de imagem como Stable Diffusion e modelos de fala como Whisper também rodam localmente, mas têm perfis de hardware diferentes e nenhum dos números de tok/s deste guia se aplica a eles.
Qual é o LLM local mais leve que ainda escreve texto utilizável?
O Qwen3 1.7B em Q4_K_M é o modelo mais leve deste guia que vale a pena usar — cerca de 1,1 GB em disco, roda em 4 GB de RAM, 25–40 tok/s somente CPU. Existem opções menores (TinyLlama 1.1B, Qwen3 0.6B) e são ainda mais rápidas, mas a qualidade da saída cai o suficiente para que sejam melhor tratadas como autocompletar do que como assistente de escrita. Abaixo de aproximadamente 1B de parâmetros, nenhum modelo leve produz texto longo de forma confiavelmente coerente.
O Gemma 4 E2B é mais rápido que o Qwen3 1.7B em um PC de baixo custo?
O Gemma 4 E2B (Google, lançado em junho de 2026, ~1.5–2 GB) é uma opção mais recente e amigável para CPU que vale a pena testar junto ao Qwen3 1.7B em sistemas com 4–8 GB de RAM. Ele registrou 15 tok/s em um Intel i7-12700 no guia de referência somente CPU da PromptQuorum — uma CPU de desktop mais potente que os mini PCs e ultrabooks testados nesta página. O Qwen3 1.7B continua sendo a escolha testada deste guia para o hardware mais fraco (25–40 tok/s em CPUs da classe Intel N100/i5-1235U); se o seu sistema for mais parecido com um i7 de desktop, experimente `ollama run gemma4:e2b` para comparar.
Fontes
- Model Card do Phi-4 Mini — Microsoft Research. 68% MMLU, 70% HumanEval. Lançado em 2025.
- Model Card do Gemma 3 — Google DeepMind. Gemma 3 2B com janela de contexto de 128K. Lançado em 2025.
- Llama 4 Scout 8B — Meta. Janela de contexto de 10M, lançado em março de 2026.
- Repositório do TinyLlama 1.1B — Stability AI. Treinamento concluído em 2024. Modelo estável, sem atualizações. Ainda recomendado para o nível de 4 GB de VRAM.
- Guia de otimização de CPU do llama.cpp — Flags de aceleração de CPU incluindo AVX-512, NEON e configuração de threads.
