Key Takeaways
- Mac mini M6 (32 GB máx.): $899. Novo Mac mini de entrada da Apple (ago. 2026) — silencioso e compacto, mas não roda modelos 70B.
- Mac mini M5 Pro (64 GB máx.): $1.699. Única configuração nova do Mac mini com memória suficiente para modelos de classe 70B. Disponível a partir de 22 de setembro de 2026 — ainda sem benchmarks independentes.
- Framework Desktop (128 GB): $1.999. Mini PC 70B mais rápido a 20+ tok/s. Projetado especificamente para LLMs locais.
- ASUS PN51 + RTX 5060 Ti: $900. Melhor custo-benefício x86 tradicional. 7B a 25 tok/s, 13B a 15 tok/s.
- Intel NUC 13 + eGPU: $1.300. Qualidade de construção premium, eGPU Thunderbolt perde 15–25% de largura de banda.
- Mini-ITX personalizado (Lian Li A4): $1.000–1.400. O mais flexível, o mais difícil de montar.
- Evitar: Mini PCs apenas com GPU integrada (1–2 tok/s em 7B), cases ATX completos (não cabem), RTX 4090 (muito grande para qualquer case SFF).
Mini PCs com silício moderno executam modelos de 7B a 70B em um formato compacto; apenas configurações com mais memória, como o Mac mini M5 Pro (64 GB) ou o Framework Desktop (128 GB unificados), têm margem suficiente para modelos de classe 70B -- builds Mini-ITX econômicos com GPU dedicada cobrem 7B-13B por menos de $1.400.
Um mini PC é um bom meio-termo entre um notebook e uma torre de desktop completa para IA local: pequeno o suficiente para ficar ao lado de um monitor, mas potente o suficiente para modelos reais com a configuração certa. O ponto-chave a verificar é a memória -- um mini PC com apenas 32 GB de memória unificada atinge o limite em modelos de tamanho médio, enquanto um com 64 GB ou mais consegue lidar com um modelo de 70B.
O que torna um mini PC adequado para LLMs locais?
Um mini PC viável precisa de slot PCIe x16, fonte SFX 450W+, resfriamento ativo e SSD 1TB+. A maioria dos mini PCs de consumo não tem slot para GPU discreta — sempre verifique antes de comprar.
- Slot PCIe x16 (comprimento completo): Para instalar uma GPU discreta. Alguns mini PCs usam docks USB-C externos — perda de largura de banda do eGPU é de 15–25% vs. PCIe interno.
- Orçamento de energia: Mínimo fonte SFX 450W. RTX 5060 Ti (165W) + CPU (65W) + placa (50W) = 280W de carga, picos acima de 420W.
- Resfriamento: Ventiladores de case ativos são necessários. Resfriamento passivo funciona para 3B em repouso; inferência sustentada de 7B requer ar forçado.
- Armazenamento: SSD de 1TB mínimo. Um modelo 7B em Q4_K_M usa ~4 GB em disco; uma biblioteca de 5 modelos ocupa 25 GB.
Mac Mini: opções M6, M5 Pro e geração anterior
A Apple atualizou o Mac mini em 25 de agosto de 2026 com o chip M6 (a partir de $899, teto de 32 GB de memória unificada) e o chip M5 Pro (a partir de $1.699, teto de 64 GB) — ambos disponíveis a partir de 22 de setembro de 2026 e agora a linha atual da Apple. Apenas a configuração M5 Pro chega a 64 GB; o M6 base tem um teto de 32 GB, insuficiente para modelos de classe 70B. Os chips anteriores M4 (a partir de $599) e M4 Pro (até 64 GB, até $2.299) são agora a geração anterior. A Apple afirma que o M6 é cerca de 40% mais rápido em CPU e até 4 vezes mais rápido em cargas de IA que o M4 anterior — uma alegação de marketing da Apple, não uma medição independente, já que os novos chips ainda não foram lançados.
- Linha atual (ago. 2026): M6 a partir de $899 (32 GB máx.) e M5 Pro a partir de $1.699 (64 GB máx.), disponíveis a partir de 22 de setembro de 2026. Para modelos de classe 70B locais, é necessária a configuração M5 Pro — o M6 tem teto de 32 GB e não é adequado.
- Geração anterior: M4 (a partir de $599) e M4 Pro (até 64 GB, até $2.299) — o número de 10–15 tok/s em 70B na tabela acima vem dessa geração agora substituída.
- Vantagens: Silencioso (sem ruído de ventilador na inferência), formato compacto, macOS + Linux via Asahi, aceleração GPU Metal do Ollama funciona imediatamente.
- Desvantagens: RAM não pode ser atualizada em nenhum dos dois chips. Ainda não existem benchmarks independentes de tok/s em 70B para o M6 ou o M5 Pro — ambos só chegam em 22 de setembro de 2026. A alegação da Apple de CPU ~40% mais rápida / IA até 4x mais rápida no M6 é um número de marketing da própria Apple, não uma medição de terceiros.
- Comando: `ollama run llama3.3:70b-instruct-q4_K_M` — funciona nativamente no Apple Silicon via Metal.
| Configuração Mac mini | Teto de memória | 7B Q4 tok/s | 70B Q4 tok/s | Preço |
|---|---|---|---|---|
| M4 (16 GB) — geração anterior | 16 GB | 40–50 | Não cabe | $599 |
| M4 Pro (64 GB) — geração anterior | 64 GB | 60–80 | 10–15 | $2.299 |
| M6 — novo (ago. 2026) | 32 GB | Sem benchmark ainda | Não cabe | a partir de $899 |
| M5 Pro — novo (ago. 2026) | 64 GB | Sem benchmark ainda | Sem benchmark ainda | a partir de $1.699 |
Framework Desktop: AMD Ryzen AI Max 395+
O Framework Desktop com AMD Ryzen AI Max 395+ e 128 GB de memória unificada LPDDR5X executa Llama 3.3 70B a 20+ tok/s por $1.999 — lançado no final de 2025 e projetado especificamente para workloads de LLM local. O Framework Desktop usa a APU Strix Halo com 128 GB de memória unificada acessível tanto para CPU quanto para a GPU integrada Radeon 8060S.
- CPU: AMD Ryzen AI Max 395+ (16 núcleos Zen 5)
- GPU: Radeon 8060S (40 CUs RDNA 3.5)
- Memória: 128 GB LPDDR5X unificada (sem VRAM separada)
- Fator de forma: estilo Mini-ITX de 4,5 L
- Energia: 120W sustentado, 200W de pico
- Vantagens: 70B a 20+ tok/s superou o Mac mini M4 Pro da geração anterior (10–15 tok/s) a preço similar — ainda não há benchmarks independentes para o novo Mac mini M5 Pro. Totalmente atualizável (placa-mãe, armazenamento). Design Linux-first. Firmware open source.
- Desvantagens: Configuração ROCm necessária para Ollama (não tão plug-and-play quanto Metal no Mac). Ruído de ventilador de 40–50 dB sob carga sustentada.
| Modelo | tok/s |
|---|---|
| Llama 3.1 8B Q4 | 45–60 |
| Llama 3.3 70B Q4 | 20–25 |
| DeepSeek-R1 70B Q4 | 18–22 |
| Qwen3 72B Q4 | 22–26 |
Qual plataforma de mini PC oferece o melhor custo-benefício?
O ASUS PN51 com Ryzen 5 e RTX 5060 Ti oferece o melhor custo-benefício x86 tradicional a $900 — desempenho LLM idêntico a uma torre completa pela metade do preço.
- Intel NUC 13 Pro (Core i7): CPU compacta e atualizável de 65W. GPU via dock eGPU Thunderbolt 3. $600 base + $450 RTX 5060 Ti + $250 dock = $1.300. Melhor qualidade de construção.
- ASUS PN51 ou PN52 (barebone Mini-ITX): Adicione Ryzen 5 ($150) + 32 GB RAM ($80) + SSD 1TB ($70) + RTX 5060 Ti ($450) = $900. Melhor custo-benefício.
- Giada F350 ou Zotac ZBOX Sphere (pré-montado): Apenas GPU integrada. Adequado para 3B–7B em velocidades de CPU. Não recomendado para inferência com GPU discreta.
- Build Mini-ITX personalizado (Lian Li A4, Dan A4-H2O): O mais flexível, o mais difícil de montar. $1.000–1.400 dependendo da escolha de GPU.
Qual GPU cabe em um case de mini PC?
A RTX 5060 Ti de 16 GB se tornou a opção ideal para Mini-ITX no final de 2025 — cabe em todos os cases a 217mm, executa 13B em Q4 com margem de VRAM, abaixo de $500. A RTX 5070 funciona na maioria dos cases mas meça — algumas variantes excedem 220mm.
| GPU | VRAM | Modelo máx. | Cabe em Mini-ITX | Preço (2026) |
|---|---|---|---|---|
| RTX 5060 Ti | 16 GB | 13B Q4 | Sim (217mm) | $450–500 |
| RTX 5070 | 12 GB | 13B Q4 | Verificar variante (225mm) | $550–650 |
| RTX 4060 Ti | 8 GB | 7B Q4 | Sim (216mm) | $280–320 |
| RTX 4070 | 12 GB | 13B Q4 | Verificar variante (limite 220mm) | $400–500 |
| RTX A4000 | 16 GB | 13B (confortável) | Verificar variante | $250–350 usado |
Como gerenciar o resfriamento em um case de mini PC compacto?
Espere 60–70°C na GPU e 50–60 dB de ruído de ventilador com carga completa de inferência LLM. Undervolting reduz as temperaturas 5–10°C sem perda de velocidade mensurável.
- Temperaturas: GPU 60–70°C, CPU 55–65°C sob inferência sustentada. Não é perigoso mas os ventiladores aceleram.
- Ruído: RTX 5060 Ti em carga total = 50–60 dB (nível de aspirador de pó). Aceitável em escritório, perturbador em espaços silenciosos.
- Undervolting: Reduza a tensão do núcleo em 50mV via MSI Afterburner (Windows) ou CoreCtrl (Linux). Reduz temperaturas 5–10°C, perde 0–2% de velocidade.
- Operação silenciosa: Substitua os ventiladores da GPU por variantes Noctua ou BeQuiet! ($50–80). Reduz o ruído em 10–15 dB.
Quais são os limites dos mini PCs para LLMs locais?
Builds Mini-ITX tradicionais têm máximo de 13B (12–16 GB de VRAM). As opções Apple Silicon e AMD Ryzen AI Max eliminam essa restrição com memória unificada de até 128 GB.
- VRAM máxima Mini-ITX tradicional: 8–16 GB (apenas uma GPU discreta). RTX 4090 não cabe (slot duplo, 280mm+ de comprimento).
- Tamanho máximo de modelo (tradicional): 13B confortavelmente. 70B requer CPU offloading e penalidade de velocidade de 3–5×.
- Caminho de atualização: Limitado. Troca de GPU pode exigir modificação do case. RAM geralmente é atualizável.
- Multi-GPU: Impossível em Mini-ITX. Sem espaço para uma segunda placa discreta.
- Longevidade: Cases de mini PC projetados para cargas de trabalho de escritório, não para inferência 24/7. Limpe os filtros de pó anualmente.
Contexto regional: residência de dados com mini PCs
Mini PCs executando LLMs locais mantêm todos os dados no local — nenhum dado sai do dispositivo, atendendo por padrão aos requisitos de residência de dados da LGPD, GDPR e APPI.
- Brasil / LGPD: A Lei Geral de Proteção de Dados (Lei 13.709/2018) exige proteção de dados pessoais. A inferência local elimina transferências internacionais de dados e acordos de processamento com a ANPD, mantendo os dados dentro do Brasil.
- UE / GDPR: A inferência local elimina acordos de processador de dados (Artigo 28 GDPR). Dados profissionais sensíveis (jurídicos, médicos, financeiros) permanecem dentro da UE sem sobrecarga contratual SCC.
- Japão / APPI: A Lei de Proteção de Informações Pessoais (APPI) requer consentimento explícito para transferência transfronteiriça de dados. A inferência local elimina completamente esse requisito.
Erros comuns com mini PCs para inferência LLM local
O erro mais comum é comprar um mini PC de consumo com GPU integrada — GPUs integradas são 10× mais lentas que placas discretas para inferência LLM.
- Comprar um mini PC pré-montado com GPU integrada para inferência 7B. GPUs integradas produzem 1–2 tok/s vs. 25 tok/s da RTX 5060 Ti.
- Escolher um dock eGPU TB3 esperando velocidade completa de GPU discreta. eGPU perde 15–25% de largura de banda PCIe — espere 12 tok/s em vez de 15 em 7B.
- Assumir que qualquer case de mini PC acomoda uma fonte ATX de tamanho completo. Mini-ITX requer fontes no formato SFX ou TFX.
- Ignorar o dimensionamento de RAM — com apenas 8 GB de RAM livre, o carregamento do modelo 7B causa swap thrashing e desacelerações de 5–10×.
- Não medir o comprimento da GPU antes de pedir — variantes da RTX 5070 variam de 210mm a 242mm; verifique o limite de slot do seu case específico.
Perguntas frequentes: mini PCs para LLMs locais
Posso executar modelos 13B sem problemas em um mini PC?
Sim, com quantização Q4 com RTX 5060 Ti (16 GB) ou RTX 4070 (12 GB). A RTX 4060 Ti (8 GB) é muito ajustada para 13B confortável — a margem de VRAM cai abaixo de 1 GB.
O Intel NUC com RTX 5060 Ti externa em dock é bom para LLMs locais?
Sim. eGPU TB3 perde 15–20% de largura de banda, então espere 12 tok/s em vez de 15 em 7B. Ainda utilizável e ótimo para espaços pequenos onde uma torre completa é impraticável.
Qual é o nível de ruído de um mini PC executando LLMs?
RTX 5060 Ti em carga total atinge 50–60 dB. Undervolting ou substituir os ventiladores da GPU por variantes Noctua reduz o ruído para 40–45 dB — aceitável para a maioria dos escritórios.
Posso instalar uma RTX 4090 em um mini PC?
Não. RTX 4090 é de slot duplo e tem 280mm+. Cases SFF personalizados (Lian Li A4, Dan A4-H2O) têm máximo de 220mm de comprimento de GPU.
Um mini PC é melhor que um laptop para LLMs locais?
Para uso estacionário, sim. Mini PC oferece melhor gestão térmica (60–70°C sustentado) e largura de banda PCIe completa. Laptop limita a ~10 tok/s sob carga sustentada. Mini PC vence para uso na mesa.
Qual é o custo total de um mini PC para inferência 7B?
Build ASUS PN51: $900. Intel NUC 13 + dock eGPU RTX 5060 Ti: $1.300. Ambos executam 7B a 20–25 tok/s; PN51 oferece melhor custo-benefício.
Um mini PC precisa de solução de resfriamento dedicada para LLMs?
Sim para inferência sustentada. Ventiladores de case Mini-ITX padrão (1×80mm) são insuficientes para RTX 5060 Ti em carga total. Adicione um ventilador lateral de 92mm ou substitua os ventiladores da GPU por variantes Noctua ($50–80).
Qual CPU de mini PC é melhor para inferência LLM local?
CPU é secundária à GPU para geração de tokens. Ryzen 7 7700X ou Intel Core i7-14700K são suficientes. Priorize o orçamento de VRAM da GPU sobre a velocidade da CPU para inferência de 7B–13B.
O novo Mac mini (M6 ou M5 Pro) consegue executar Llama 3.3 70B?
Apenas a configuração M5 Pro (a partir de $1.699, teto de 64 GB de memória unificada) tem memória suficiente para modelos de classe 70B — ainda não há benchmarks independentes de tok/s, já que chega em 22 de setembro de 2026. O M6 base (a partir de $899) tem teto de 32 GB de memória unificada e não é adequado para modelos 70B. Para comparação, o M4 Pro anterior (64 GB, $2.299) atingia 10–15 tok/s no 70B.
O novo Mac mini M6 suporta 64 GB de memória unificada como o antigo M4 Pro?
Não — o Mac mini M6 base tem teto de 32 GB de memória unificada, abaixo do máximo de 64 GB do M4 Pro. Para obter 64 GB de memória unificada na nova linha do Mac mini, é necessária a configuração M5 Pro (a partir de $1.699), não o M6 (a partir de $899).
O Framework Desktop é melhor que o novo Mac mini para LLMs locais?
O Framework Desktop ($1.999, 128 GB de memória unificada) ainda tem mais margem de memória que qualquer chip do novo Mac mini — o M5 Pro tem teto de 64 GB e o M6 de 32 GB. Frente ao M4 Pro anterior, o Framework Desktop atingiu 20+ tok/s no 70B, superando os 10–15 tok/s do Mac mini; ainda não há benchmark independente para o novo chip M5 Pro. Em facilidade de configuração, o Mac mini ainda vence — Ollama funciona com Metal imediatamente, enquanto o Framework requer configuração do ROCm.
Qual configuração de Mac mini é a melhor para LLMs locais — M6 ou M5 Pro?
Para modelos de classe 70B, apenas o M5 Pro (a partir de $1.699, até 64 GB de memória unificada) tem margem suficiente — o M6 (a partir de $899) tem teto de 32 GB e não é adequado para modelos 70B, nem mesmo com quantização Q4. Se você só precisa de modelos 7B–13B, o M6 base é suficiente. O M4 Pro anterior (até 64 GB, até $2.299) está sendo descontinuado, mas atingia 10–15 tok/s no 70B se você encontrar uma unidade com desconto.
Qual é uma boa alternativa ao Mac mini para LLMs locais?
O Framework Desktop ($1.999, 128 GB de memória unificada) tem mais margem de memória que qualquer nova configuração do Mac mini (M6: 32 GB, M5 Pro: 64 GB) e, frente ao M4 Pro anterior, superou o Mac mini em velocidade bruta no 70B (20+ tok/s vs 10–15 tok/s), ao custo de um cooler mais barulhento e uma etapa extra de configuração do ROCm. Para flexibilidade x86 em vez de memória unificada, um build com ASUS PN51 + RTX 5060 Ti ($900) cobre modelos 7B–13B com custo inicial menor.
Qual é o melhor mini PC econômico para LLMs locais em 2026?
Um barebone ASUS PN51 ou PN52 com Ryzen 5, 32 GB de RAM, SSD de 1TB e RTX 5060 Ti de 16 GB totaliza cerca de $900 — o build de mini PC de menor custo que ainda atinge 7B a 25 tok/s e 13B a 15 tok/s com GPU dedicada. Mini PCs prontos com gráficos integrados custam menos, mas caem para 1–2 tok/s em 7B, então não são uma opção econômica real para inferência de LLM local.
