Principais conclusões
- Um distill DeepSeek-R1 precisa da rede só uma vez (para baixar). No momento da inferência, ele roda totalmente offline.
- Para raciocínio em chinês, os distills baseados em Qwen2.5 (1.5B/7B/14B/32B) lidam com o chinês melhor que os 8B/70B baseados em Llama 3.
- Combine hardware com modelo: 16 GB → 14B, 24 GB → 32B; a correspondência completa por GPU está nas referências Bite.
- A configuração aqui é só do lado do modelo — Ollama ou LM Studio. A mecânica de rede/firewall é referenciada por link para evitar duplicação.
- Verifique o modo "offline" empiricamente: bloqueie a rede ou monitore o tráfego de saída durante uma sessão e confirme zero saída de dados.
- Auto-hospedagem offline significa nenhuma dependência do Grande Firewall e nenhum fluxo de dados transfronteiriço.
- Rode cada distill com temperatura 0.6 e sem prompt de sistema.
Por que rodar o DeepSeek offline?
Rodar o DeepSeek offline dá a você controle total dos dados e remove qualquer dependência de uma API hospedada ou das condições de rede — o modelo responde a partir de hardware local sem nada sair da máquina. Para trabalho sensível à soberania, essa é a diferença entre uma ferramenta que você controla e um serviço do qual você depende.
Quatro motivações dominam: soberania de dados (prompts e saídas nunca deixam seu ambiente), nenhuma cobrança de API por token depois que o hardware é comprado, independência de restrições de rede (concreto para usuários atrás do Grande Firewall — um modelo offline não tem nenhum endpoint estrangeiro a alcançar) e confiabilidade (sem indisponibilidade ou limite de taxa em um endpoint hospedado). Nenhuma dessas razões é "é automaticamente mais barato" — veja a comparação de custos abaixo.
Esta é a contrapartida prática da análise de privacidade em O DeepSeek local resolve o problema de dados da China? — aquela página explica por que a auto-hospedagem local remove a preocupação com o fluxo de dados; esta mostra como construí-la e qual hardware comprar.
📍 Em uma frase
Rodar o DeepSeek offline mantém cada prompt e saída em hardware local, removendo a dependência de uma API hospedada e qualquer restrição de rede.
💬 Em termos simples
Um modelo offline é como um livro que você possui versus um site que você visita. Uma vez na sua estante, você não precisa da internet — nem da permissão de ninguém — para lê-lo.
DeepSeek local vs a API DeepSeek
Não presuma que o local é mais barato — o preço da API hospedada da DeepSeek é muito baixo, então o motivo honesto para se auto-hospedar é privacidade, controle e operação offline, não uma economia garantida. Em 25 de agosto de 2026 (verificado na própria página de preços da API da DeepSeek), o DeepSeek-V4 Flash custa US$ 0,007/US$ 0,22 por milhão de tokens de entrada (cache atingido/cache não atingido, fora de pico) e US$ 0,66 por milhão de tokens de saída fora de pico; o DeepSeek-V4 Pro custa US$ 0,022/US$ 0,66 na entrada e US$ 1,98 na saída fora de pico, aproximadamente dobrando durante os horários de pico em dias úteis (01h00–04h00 e 06h00–10h00 UTC). Com esses preços, um usuário leve ou ocasional pode gastar muito pouco na API por bastante tempo antes que o hardware se pague.
A matemática do ponto de equilíbrio depende inteiramente do seu volume de uso: uso diário intenso (muitos milhões de tokens/mês) inclina a balança para o hardware ao longo de meses; uso ocasional ou irregular pode nunca atingir o equilíbrio. Use a calculadora de custo de IA local do PromptQuorum com seu próprio gasto mensal esperado para obter um número real em vez de adivinhar.
Fator | API DeepSeek | DeepSeek local |
|---|---|---|
| Hardware | Nenhum | US$ 400–2.800+ dependendo do nível (veja a seção de orçamento) |
| Internet | Necessária | Não é necessária após baixar o modelo |
| Custo por token | Sim (veja os preços acima) | Nenhum custo contínuo de API |
| Privacidade | Prompts enviados a um endpoint hospedado | Nada sai da máquina |
| Manutenção | Nenhuma | Você gerencia o hardware e a pilha de software |
| Controle do modelo | Hospedado, controlado pelo fornecedor | Auto-controlado, qualquer distill que você escolher |
| Capaz de offline | Não | Sim, após o download único |
| Melhor para | Uso ocasional, conveniência | Uso diário/intenso, privacidade, soberania |
O verdadeiro motivo para se auto-hospedar é privacidade + independência + controle — não economia automática de custos. Se você usa o DeepSeek ocasionalmente, a API é muito provavelmente mais barata e mais simples. No Brasil, os custos de importação de hardware tendem a elevar significativamente esses valores em relação aos preços dos EUA — pesquise os preços de varejo locais antes de decidir.
Qual distill do DeepSeek é melhor para raciocínio em chinês?
Para raciocínio em chinês, escolha um distill DeepSeek-R1 baseado em Qwen2.5 (7B, 14B ou 32B) — o Qwen2.5 foi treinado com forte cobertura do chinês, então esses distills lidam com prompts e saídas em chinês visivelmente melhor que os 8B e 70B baseados em Llama 3. O comportamento de raciocínio é o mesmo em todos os distills; o modelo base determina a qualidade do idioma.
Escolhas práticas para cargas em chinês: o 14B em uma placa de 16 GB é o padrão equilibrado, e o 32B em uma placa de 24 GB é a melhor opção de GPU única. Ambos raciocinam em chinês com fluência por causa da base Qwen2.5. Reserve os distills baseados em Llama para trabalho predominantemente em inglês ou requisitos de licença Llama.
Consultas principais que isso atende: 本地部署 deepseek (implantar o DeepSeek localmente), deepseek 离线 (DeepSeek offline) e deepseek 私有化部署 (implantação privada do DeepSeek). A resposta para as três é a mesma — um distill baseado em Qwen2.5 rodado localmente com Ollama ou LM Studio.
📍 Em uma frase
Para raciocínio em chinês, escolha um distill DeepSeek-R1 baseado em Qwen2.5 (7B/14B/32B); a base Qwen lida com o chinês muito melhor que os distills baseados em Llama.
Qual modelo rodar, e quanta VRAM?
Combine o distill com sua VRAM e caso de uso — os mesmos níveis de qualquer implantação do DeepSeek-R1, mais para que cada nível é realmente bom. Esta é a versão resumida; as duas referências Bite têm a tabela completa por GPU e a VRAM por quantização.
- A visão do PromptQuorum: para a maioria das pessoas, o 14B ou o 32B é o ponto ideal. O salto para o 70B é uma categoria de hardware genuinamente diferente (GPUs duplas, estação de trabalho com muita memória, resfriamento e energia sérios) — trate isso como sua própria decisão de compra, não como um próximo passo natural a partir do 32B.
- O modelo completo de 671B não é um alvo normal de PC de consumidor. Se sua carga de trabalho precisa dessa escala, compare uma estação de trabalho de IA dedicada contra os custos de nuvem/API em vez de montá-la aos poucos — veja o guia de construção de estação de trabalho de IA local.
VRAM | Melhor distill (offline) | Veredito | Melhor para |
|---|---|---|---|
| 8 GB | 7B ou R1-0528-Qwen3-8B | Bom ponto de entrada | Notebooks, GPUs baratas, servidores pequenos, experimentação |
| 16 GB | 14B (Qwen2.5) | Melhor custo-benefício | A maioria dos usuários sérios; padrão equilibrado, chinês forte |
| 24 GB | 32B (Qwen2.5) | Melhor com uma única GPU | Entusiastas que querem um salto real sem multi-GPU |
| 48 GB+ / GPU dupla | 70B (Llama 3) | Território de estação de trabalho séria | Profissionais; saída em chinês mais fraca que os distills Qwen |
| ~400 GB+ | DeepSeek-R1 completo (671B) | Não é uma carga de trabalho normal para consumidor | Apenas clusters multi-GPU de classe empresarial — não compre um mini PC esperando isso |
Para um endpoint offline sempre ligado e de baixo consumo, um mini PC capaz roda os distills 7B e 14B de forma silenciosa — veja Melhores mini PCs para LLMs locais. Para a correspondência exata de GPU, veja as referências Bite em Guias relacionados.
Melhores classes de hardware para o DeepSeek local
Em vez de uma única indicação de produto, aqui estão os quatro caminhos de hardware realistas — escolha o que combina com suas prioridades e depois use o guia dedicado para as escolhas e preços atuais.
- GPU NVIDIA — melhor para desempenho e compatibilidade máximos. A escolha padrão: o suporte de software mais amplo (Ollama, vLLM, llama.cpp funcionam bem em CUDA), as melhores opções de VRAM por dólar nos níveis de 16 GB/24 GB, e a solução de problemas mais fácil, já que a maioria das ferramentas de LLM local é desenvolvida primeiro para NVIDIA. Veja o melhor guia de compra de GPU para LLMs locais para as escolhas atuais.
- GPU AMD — melhor para compradores dispostos a trabalhar com o ecossistema ROCm. Potencialmente um bom custo-benefício de VRAM, mas verifique a compatibilidade ROCm/software para seu runtime exato (Ollama, llama.cpp) antes de comprar — o suporte é mais restrito que o da NVIDIA e varia por geração de placa.
- Apple Silicon — melhor para uma máquina silenciosa e de baixo consumo com grande memória unificada. A vantagem não é a VRAM de GPU tradicional, é a capacidade de memória compartilhada — um Mac com RAM unificada suficiente pode carregar distills maiores que uma GPU dedicada de preço comparável, com uma fração do consumo de energia. Veja Melhor Mac para IA local.
- Mini PC — melhor para um servidor de IA local sempre ligado. A escolha certa se a carga de trabalho for 7B, um pouco de 14B, integração com Home Assistant, RAG ou um assistente local em segundo plano em vez de velocidade máxima de inferência. Veja Melhores mini PCs para LLMs locais.
- Aluguel de GPU em nuvem — melhor se você quer testar um nível antes de comprar, ou precisa de capacidade extra ocasional. Não é "offline", mas é uma forma legítima de experimentar o desempenho de classe 32B/70B antes de se comprometer com hardware. Veja o guia de aluguel de GPU em nuvem.
Nossa configuração local recomendada para o DeepSeek
Para a maioria dos leitores do PromptQuorum que querem um salto real no raciocínio local sem entrar em território multi-GPU: uma GPU de 24 GB, 64 GB de RAM do sistema e 2 TB de armazenamento NVMe, rodando o DeepSeek-R1 32B via Ollama. Isso é um alvo de configuração, não um produto específico — use o guia de compra de GPU abaixo para as escolhas e preços atuais.
- Usos realistas nesse nível: raciocínio em chinês, assistência de programação, análise de documentos, um assistente privado, RAG sobre documentos locais e experimentação com agentes locais.
- Orçamento limitado? Desça para o nível de 16 GB / 14B — veja Qual modelo e quanta VRAM? acima e a divisão de orçamento abaixo.
Componente | Especificação alvo |
|---|---|
| GPU | 24 GB de VRAM |
| RAM do sistema | 64 GB |
| Armazenamento | 2 TB NVMe |
| Software | Ollama |
| Modelo | DeepSeek-R1-Distill-Qwen-32B |
Como você configura o DeepSeek offline?
A configuração offline é só do lado do modelo: baixe uma vez, depois rode sem rede. Estes são os passos com o Ollama (o LM Studio é o equivalente com interface gráfica — baixe o modelo e depois fique offline).
- 1Instale o Ollama ou o LM Studio
Why it matters: Eles rodam o modelo localmente sem dependência externa no momento da inferência; instale uma vez online. - 2Baixe o distill uma vez
Why it matters: Rode `ollama run deepseek-r1:14b` (ou seu nível) conectado — este é o único passo que precisa de rede. - 3Desconecte ou bloqueie a rede
Why it matters: Depois que o modelo está em cache, corte o acesso à rede; o modelo entrega respostas inteiramente a partir dos pesos locais. - 4Defina temperatura 0.6, limpe o prompt de sistema
Why it matters: Evita o modo de falha por repetição do R1; coloque todas as instruções no prompt do usuário. - 5Rode a inferência offline
Why it matters: Cada prompt e saída agora permanece na máquina sem saída de dados — confirme com o passo de verificação abaixo.
ollama pull deepseek-r1:14b # uma vez, online
# depois desconecte / bloqueie a rede
ollama run deepseek-r1:14b # inferência totalmente offlineE quanto à mecânica de rede e firewall?
O próprio modelo offline não precisa de configuração de firewall, VPN ou tunelamento de rede — ele não tem nenhum endpoint estrangeiro a alcançar — então o único trabalho de rede é garantir que nada mais na máquina fique se comunicando para fora. Esse tema geral (regras de firewall, isolamento de rede, bloqueio de conexões de saída) é tratado em profundidade em outro lugar e não é duplicado aqui.
Para a configuração completa de firewall e rede offline — incluindo isolar uma estação de trabalho e travar o tráfego de saída — veja IA local atrás de um firewall: offline 2026. Este artigo cobre a escolha do modelo DeepSeek e a configuração do modelo offline; aquele cobre a mecânica de rede.
Como você verifica que está realmente offline?
Prove o status offline de forma empírica: rode uma sessão de inferência completa com o tráfego de saída monitorado ou a rede desativada, e confirme que há zero conexões de saída do processo do modelo. Não presuma — demonstre, porque é isso que torna a alegação de soberania auditável.
Dois métodos rápidos: desative o adaptador de rede (ou desconecte o cabo) e confirme que a inferência ainda funciona — prova de que o modelo não precisa de conectividade; ou mantenha a rede ativa, mas observe as conexões de saída com uma captura de pacotes ou um firewall por processo e confirme que o processo do Ollama/LM Studio não abre nenhuma durante uma sessão.
Dica pro de configuração: temperatura 0.6 e sem prompt de sistema
Defina a temperatura em 0.6 (0.5–0.7 é seguro) e não use prompt de sistema — coloque todas as instruções no prompt do usuário. Isso evita o modo de falha por repetição e incoerência ao qual os distills DeepSeek-R1 são propensos, e importa tanto offline quanto online.
Comprar hardware ou usar a API?
Essa é a decisão real, e ela depende de quanto você vai realmente usar o DeepSeek — não de qual opção é "melhor" no abstrato.
- Compre hardware se: você usa o DeepSeek todos os dias, a privacidade é importante para o seu trabalho, você precisa de operação offline, você planeja rodar vários serviços locais na mesma máquina, você já tem hardware adequado, ou você quer acesso previsível a longo prazo sem depender das mudanças de preço de um fornecedor.
- Use a API se: você usa o DeepSeek ocasionalmente, você não quer manter hardware nem uma pilha de software, você precisa de velocidade máxima de inferência sem comprar GPUs de classe empresarial, ou a operação offline genuinamente não importa para o seu caso de uso.
- O preço atual da API da DeepSeek (verificado acima) é baixo o suficiente para que usuários ocasionais provavelmente saiam melhor apenas pagando pelo uso da API em vez de comprar hardware para economizar — o argumento do hardware é sobre privacidade e controle, não economia garantida.
- Faça suas próprias contas com a calculadora de custo de IA local antes de decidir — coloque seu gasto mensal esperado na API e o preço do hardware para ver uma estimativa real de ponto de equilíbrio em vez de uma regra geral.
Orçamento de hardware por nível
Contexto importante em 2026: os preços de GPU e VRAM subiram substancialmente no último ano por causa da pressão no mercado de memória — uma placa de 24 GB usada que custava cerca de US$ 1.000–1.300 em 2025 estava sendo negociada por perto de US$ 2.200–2.800 em agosto de 2026. Planeje o orçamento de acordo em vez de presumir que os preços do ano passado ainda valem; o nível de entrada de 16 GB se manteve comparativamente estável. Todos os valores abaixo estão em dólares americanos; no Brasil, os impostos de importação tendem a empurrar esses preços significativamente para cima — pesquise os preços de varejo locais antes de comprar.
Orçamento | Objetivo | Notas |
|---|---|---|
| Até US$ 500 | DeepSeek 7B, cargas pequenas de 14B | Sistemas de GPU usados ou de entrada |
| US$ 500–900 | DeepSeek local 14B | GPU de 16 GB — ponto ideal para iniciantes, preços aqui têm ficado relativamente estáveis |
| US$ 1.500–3.000 | DeepSeek 32B | GPU de 24 GB — esse nível está significativamente mais caro em 2026 do que em anos anteriores; verifique os preços atuais antes de planejar |
| US$ 3.000+ | IA local séria, espaço para crescer | GPU de 24 GB+, 64–128 GB de RAM, vários discos NVMe |
| US$ 5.000+ | Modelos 70B e maiores | Compare uma estação de trabalho de IA dedicada contra os custos de nuvem/API nesse orçamento — veja o guia de construção da estação de trabalho |
O que não comprar
Alguns erros comuns que vale a pena nomear claramente, já que uma página que só diz "compre isto" parece uma página de vendas.
- Não compre um sistema de GPU de US$ 2.000+ só para rodar um modelo 7B — isso é desperdício de dinheiro que o nível de entrada já resolve.
- Não compre 128 GB de RAM do sistema sem uma carga de trabalho que realmente precise disso; a VRAM, não a RAM do sistema, costuma ser o verdadeiro gargalo para inferência em GPU.
- Não compre uma GPU AMD só porque as especificações no papel parecem impressionantes — verifique antes a compatibilidade ROCm/software para seu runtime exato.
- Não compre um mini PC esperando inferência rápida em 70B ou no 671B completo — os requisitos de memória e processamento nessa escala são uma classe de hardware completamente diferente.
- Não presuma que o local é mais barato antes de fazer as contas — um usuário ocasional muito provavelmente é mais bem atendido pela API (veja a comparação de custos acima).
Perguntas frequentes
O DeepSeek pode rodar completamente offline?
Sim. Depois que um distill foi baixado, a inferência pode continuar com a rede desativada — você pode desconectar ou bloquear a rede por completo e ele continua funcionando a partir dos pesos locais.
O DeepSeek-R1 precisa de VPN na China?
Não quando o modelo roda localmente. Um modelo offline não tem nenhum endpoint estrangeiro a alcançar, então VPNs e contornos de firewall são irrelevantes para a inferência. A única tarefa de rede é garantir que nada mais na máquina envie dados para fora.
Qual distill do DeepSeek é melhor para o chinês?
Um distill baseado em Qwen2.5 (7B, 14B ou 32B). O Qwen2.5 tem forte cobertura do chinês, então eles lidam com prompts e saídas em chinês melhor que os distills 8B e 70B baseados em Llama 3.
Quanta VRAM o DeepSeek 32B precisa?
Uma GPU de 24 GB é um alvo prático para uma implantação quantizada do 32B, dependendo da quantização e do runtime — veja a tabela Qual modelo e quanta VRAM acima para a divisão completa por nível.
Um mini PC pode rodar o DeepSeek?
Sim, especialmente o distill 7B e algumas configurações de 14B. Mini PCs são uma boa escolha para um endpoint sempre ligado e de baixo consumo, mas geralmente não são a escolha certa para o desempenho máximo do DeepSeek nem para modelos de 70B+.
Posso rodar o DeepSeek no Apple Silicon?
Sim. Sistemas Apple Silicon com grande memória unificada podem ser particularmente interessantes para experimentação com LLM local, já que a vantagem é a capacidade de memória compartilhada em vez da VRAM de GPU tradicional — veja a seção Melhores classes de hardware acima.
O DeepSeek local é mais barato que a API?
Não necessariamente. O hardware tem um custo inicial substancial, e o preço atual da API da DeepSeek é baixo. As maiores vantagens da implantação local são privacidade, controle e operação offline, não economia garantida de custos — faça suas próprias contas com a calculadora de custo vinculada.
Como sei que o modelo offline não está enviando dados para lugar nenhum?
Monitore o tráfego de saída durante uma sessão ou desative a rede por completo e confirme que a inferência ainda funciona. Um modelo carregado localmente não precisa, por natureza, de uma conexão com a API DeepSeek para fazer inferência, mas você deve verificar isso empiricamente para a sua própria implantação em vez de simplesmente presumir.
Que hardware roda bem o DeepSeek offline?
Uma GPU de 16 GB roda o distill 14B e uma GPU de 24 GB roda o 32B. Para um endpoint silencioso e sempre ligado, um mini PC capaz dá conta do 7B e do 14B. Veja os bites de GPU e VRAM para a correspondência exata, e a seção Melhores classes de hardware para os prós e contras de NVIDIA/AMD/Apple Silicon/mini PC.
Posso rodar o DeepSeek-R1 completo offline?
Não em hardware de consumo. O R1 671B completo precisa de aproximadamente 400 GB+ de VRAM em quantização nível Q4. A auto-hospedagem offline usa, na prática, os distills (1,5B–70B), que rodam em GPUs locais.
Onde ficam os passos de firewall e rede?
Este guia deliberadamente não reexplica a mecânica de firewall e isolamento de rede. Veja IA local atrás de um firewall: offline 2026 para o travamento de rede completo; aqui cobrimos a escolha do modelo DeepSeek, o hardware e a configuração do modelo offline.
Que configurações devo usar para o DeepSeek offline?
Temperatura 0.6 sem prompt de sistema, instruções na mensagem do usuário. É a configuração padrão do DeepSeek-R1 e evita o modo de falha por repetição.
Registro de atualizações
- Reformulação completa em página afiliada em 25/08/2026: adicionada uma divisão por classe de hardware (NVIDIA/AMD/Apple Silicon/mini PC/nuvem), um alvo de configuração recomendada, uma comparação de preços verificada da API DeepSeek, uma seção de decisão comprar vs. API, uma tabela de orçamento de hardware 2026 corrigida (os preços de GPU/VRAM subiram substancialmente de um ano para outro), e uma seção "o que não comprar". Corrigida uma afirmação exagerada ("os pesos abertos da DeepSeek não têm telemetria" → verificar empiricamente por implantação em vez de afirmar de forma categórica).
- Publicado em 19/06/2026. Próxima revisão prevista para 25/09/2026 (nível de atualização mensal, refletindo a evolução rápida dos preços de GPU/API).
- Cobre a escolha do modelo DeepSeek offline, a escolha do modelo em chinês, a escolha da classe de hardware e a configuração do modelo offline. A mecânica de rede/firewall é referenciada por link de propósito. Monetiza a infraestrutura de hardware ao redor do DeepSeek (guias de GPU/Mac/mini PC/estação de trabalho), não a própria API do DeepSeek.
