Skip to main content
PromptQuorum

Melhor Mini PC para Servidor Ollama Sempre Ligado 2026

Melhor Mini PC para Servidor Ollama Sempre Ligado 2026

Esta página contém links de referência para produtos de terceiros. O PromptQuorum não está inscrito em nenhum programa de afiliados — são links simples que não geram comissão. Clicar nos links e os próximos passos são de sua inteira responsabilidade. Estes links não representam qualquer endosso ou verificação por parte do PromptQuorum.

Hardware & PerformanceIntermediário

Pontos principais

  • Mini PCs consomem 15–45 W contra 200–350 W das GPUs de mesa — a economia 24/7 é relevante
  • UM890 Pro executa modelos 7B somente com CPU a 12–18 tok/s; ideal para uso como servidor de API
  • AOOSTAR GEM12 Pro + eGPU OCuLink desbloqueia aceleração de GPU sem PC de mesa
  • Mac Mini M5 Pro: 64 GB de memória unificada é o teto para modelos 30B; o M6 base chega a 32 GB — ambos disponíveis em 22 de setembro de 2026
  • Beelink SER8 é o ponto de entrada abaixo de $400 — 32 GB de RAM para 7B e 13B

Quick Answers

Um mini PC consegue executar modelos de 13B ou maiores em velocidade útil?
Sim — com RAM suficiente. O UM890 Pro com 64 GB executa o Llama 3.3 13B Q8 completamente em RAM a ~8–12 tok/s somente com CPU. Com a iGPU Radeon 780M acelerando, modelos Q4 rodam a 10–18 tok/s — útil para resumo em segundo plano ou chamadas de API. Para modelos 30B+, o Mac Mini M5 Pro (64 GB de memória unificada, a partir de $1.699) tem memória suficiente — o que o coloca acima de $1.500. O M6 básico ($899, 32 GB máx.) não tem memória suficiente para modelos 30B.
O Ollama funciona bem como servidor de rede em um mini PC?
Sim. Configure OLLAMA_HOST=0.0.0.0 e o Ollama atende requisições de qualquer dispositivo na sua LAN. Combine com Open WebUI (contêiner Docker) para uma interface baseada em navegador acessível de telefones, tablets e PCs. Lida com uma requisição simultânea sem problema.
Vale a pena configurações com eGPU?
Para o Ollama especificamente, uma eGPU OCuLink (AOOSTAR GEM12 Pro + RTX 3090) é o melhor dos dois mundos: velocidade de GPU de mesa com consumo elétrico de mini PC em repouso. OCuLink (PCIe 4.0 x4) entrega ~80% da largura de banda de um slot PCIe x16 direto — suficiente para inferência de LLM com gargalo mínimo.

Quer a análise completa?

Ler o guia completo →