Principais conclusões
- WeChatFerry + Ollama + Qwen3 é a combinação que funciona em 2026 para um assistente do WeChat com LLM local — somente Windows, sem nenhuma API na nuvem
- Compre o hardware pela tarefa real: uma máquina N150 econômica (GMKtec G3 Plus) já basta para um assistente leve com Qwen3 3B
- Para um servidor de IA local sempre ativo que cresça além de um bot simples, o Minisforum UM890 Pro (no Brasil, a partir de ~R$ 3.900 importado) é o melhor investimento — bem mais caro, mas outra classe de capacidade
- O Qwen3 8B é o modelo inicial recomendado para qualidade em chinês; a configuração leva de 30 a 60 minutos para quem tem familiaridade com Python
- Risco real: os termos de uso do WeChat proíbem bots automatizados — isso é uso de produtividade pessoal, não uma ferramenta de envio em massa
- Alegação de privacidade, formulada com precisão: o conteúdo das mensagens não vai para uma API de LLM na nuvem — o WeChat em si continua rodando pela infraestrutura da Tencent
- Compre um mini PC N150 econômico (GMKtec G3 Plus ou Beelink EQ14) se: o assistente do WeChat é sua única carga séria de IA local, um modelo Qwen3 3B já é suficiente para você, e o baixo consumo de energia em operação 24/7 importa mais que a velocidade.
- Compre uma máquina classe Ryzen (Minisforum UM890 Pro) se: você quer que o Qwen3 8B ou 14B pareça responsivo, planeja adicionar RAG, busca em documentos ou outros serviços locais depois, ou quer folga de verdade em vez de comprar duas vezes.
- Pule este projeto por completo se: precisa rodá-lo nativamente em macOS/Linux (o WeChatFerry é exclusivo do Windows), não está disposto a aceitar o risco de conta de uma integração não oficial, ou precisa de um volume de mensagens além do uso pessoal.
- Uma configuração econômica (16 GB de RAM, qualquer CPU moderna) é realmente suficiente para um assistente pequeno de baixo volume — não invista além disso para esse uso.
- O nível recomendado (32 GB, CPU classe Ryzen) é o ponto certo para a maioria de quem quer construir um assistente pessoal de verdade — o Qwen3 8B roda confortavelmente ali, junto com a ponte do WeChat e o próprio Ollama.
- O nível pesado é para leitores cujo objetivo real é um servidor de IA local de uso geral, no qual o bot do WeChat é apenas uma interface entre várias — RAG, busca em documentos e múltiplos serviços é que precisam dessa folga extra, não o bot em si.
| Nível | RAM | Modelo que cabe | Melhor para |
|---|---|---|---|
| Econômico | 16 GB | Qwen3 3B | Testar o conceito, uso pessoal de baixo volume, respostas simples em chinês |
| Recomendado | 32 GB | Qwen3 8B | A maioria das instalações sérias — mais histórico, operação 24/7, respostas mais rápidas |
| IA local pesada | 64 GB+ | Qwen3 14B e maiores | Vários usuários simultâneos, RAG, busca em documentos, fluxos de agentes, serviços adicionais de IA local |
- A folga de RAM é o motivo real para escolhê-lo, não apenas a velocidade da CPU. Um servidor de IA local precisa de memória para o sistema operacional, o Ollama, o modelo em si, o histórico de conversa e — se você adicionar depois — embeddings e um banco de dados. Um teto de 96 GB dá espaço real para crescer; uma máquina N150 econômica estanca bem abaixo disso.
- Dois slots de SSD permitem dedicar um ao sistema operacional e aplicativos, e o segundo a modelos e dados — relevante assim que você roda mais de um serviço de IA local.
- A rede dupla 2,5GbE é desnecessária para um bot simples do WeChat, mas útil se a máquina virar depois um servidor local mais amplo na sua rede.
- A desvantagem honesta: você não precisa de tanta máquina para o Qwen3 3B ou uso leve do 8B. Se "eu quero um bot do WeChat barato" é todo o objetivo, isso é superdimensionado — veja a opção econômica abaixo. Se o objetivo é "um servidor de IA local sempre ativo que começa com o WeChat e pode crescer", o UM890 Pro é o gasto mais defensável.
- Escolha uma máquina N150 se: o preço é o mais importante, um modelo Qwen3 3B já é suficiente para o seu uso, você quer consumo bem baixo, e a máquina também vai rodar o Home Assistant ou outros serviços leves.
- Escolha o UM890 Pro em vez disso se: a IA local é a carga principal, você quer que o Qwen3 8B ou maior pareça responsivo, quer 32 GB+ de RAM, ou planeja rodar RAG ou vários serviços de IA local na mesma máquina.
- Veja a análise completa do GMKtec G3 Plus e a análise do Beelink EQ14 para as especificações completas, ou o comparativo dos melhores mini PCs para IA local para mais opções.
- 1Instalar o Ollama e baixar o Qwen3 8B
Why it matters: Baixe o Ollama em ollama.com e execute: `ollama pull qwen3:8b` - 2Fazer login no WeChat PC
Why it matters: Abra o WeChat no Windows e escaneie o código QR para fazer login. Mantenha-o logado e rodando em segundo plano. - 3Instalar o WeChatFerry
Why it matters: Instale via pip: `pip install wcferry`. O WeChatFerry se injeta no processo do WeChat para expor uma API de mensagens — confira no GitHub qual versão do WeChat é compatível atualmente antes de continuar. - 4Criar o manipulador de mensagens em Python
Why it matters: Crie `wechat_bot.py` com um cliente WeChatFerry, chamadas à API HTTP do Ollama e a lógica de roteamento, incluindo a verificação da palavra-chave de gatilho. - 5Testar com uma mensagem para si mesmo
Why it matters: Envie uma mensagem do WeChat começando com "@ai" para você mesmo e verifique se o bot responde em cerca de 10 a 15 segundos na CPU. - 6Adicionar memória de conversa
Why it matters: Armazene as últimas 10 a 20 mensagens por contato para permitir contexto de conversa em múltiplas interações. - 7Rodar como serviço em segundo plano
Why it matters: Use o NSSM (Non-Sucking Service Manager) para rodar o script em Python como um serviço do Windows que inicia automaticamente, para que o bot sobreviva a reinicializações.
- O Qwen3:8b é o primeiro modelo sensato para a maioria dos usuários — capacidade suficiente para conversa em chinês, resumo, reescrita, perguntas e respostas, e automações simples de produtividade pessoal.
- Não escolha um modelo só porque o arquivo "cabe" na RAM — caber não significa rápido. Para um assistente de conversa, a latência de resposta importa; um modelo que tecnicamente carrega mas responde em 20 segundos ou mais parece quebrado em um app de chat.
- Em hardware só com CPU (uma máquina N150), espere uma geração visivelmente mais lenta que esses números para um modelo de 8B ou maior — exatamente a lacuna que o Minisforum UM890 Pro preenche.
| Modelo | Tamanho aprox. (Q4) | Qualidade em chinês | Velocidade (CPU) | Velocidade (8 GB VRAM) |
|---|---|---|---|---|
| Qwen3:3b | ~2 GB | Boa | 8–12 tok/s | 60+ tok/s |
| Qwen3:8b | ~4,7 GB | Excelente — melhor ponto de partida | 3–5 tok/s | 30–45 tok/s |
| Qwen3:14b | ~9 GB | Melhor | 1–2 tok/s | 15–20 tok/s |
| Llama3.1:8b | ~4,7 GB | Moderada | 3–5 tok/s | 30–45 tok/s |
- RAG local: faça perguntas sobre seus próprios documentos sem que eles saiam da sua rede.
- Base de conhecimento pessoal: pesquise notas, PDFs e informações salvas pela mesma interface do WeChat.
- Automação: dispare scripts e serviços locais a partir de uma mensagem do WeChat.
- Home Assistant: envie comandos para sua casa inteligente — veja Conectar o Ollama ao Home Assistant.
- Tarefas agendadas: gere resumos ou relatórios diários.
- Isso transforma o projeto de "um bot do WeChat" em um servidor de IA local privado com o WeChat como uma das interfaces — veja Agentes de IA locais com MCP para o próximo passo.
- A alegação precisa e defensável: inferência de LLM local significa que o conteúdo que você envia ao seu assistente não é encaminhado a um provedor de LLM na nuvem de terceiros para processamento. Isso é um benefício real e concreto de privacidade.
- O que essa configuração NÃO sustenta: que suas comunicações no WeChat em geral são privadas, ou que a Tencent não consegue ver metadados ou conteúdo de mensagens pela própria plataforma — essa é uma questão separada que este projeto não muda.
- Somente Windows: o WeChatFerry usa injeção de DLL no Windows para se conectar ao processo do WeChat. Não funciona nativamente em macOS ou Linux; rodar o Windows em uma VM (Parallels, VMware Fusion) é uma alternativa possível, com complexidade adicional.
- Dependência da versão do cliente do WeChat: o WeChatFerry acompanha versões específicas do cliente WeChat para PC (atualmente 3.9.12.17). Confira a lista de compatibilidade no repositório do WeChatFerry no GitHub antes de atualizar o WeChat, ou o bot pode parar de funcionar silenciosamente.
- Latência: a inferência somente em CPU em um modelo de 8B leva cerca de 5 a 15 segundos por resposta, o que pode parecer lento em um contexto de chat. Uma GPU classe 8 GB ou uma iGPU Ryzen reduz isso de forma significativa.
- O risco de conta é real, não teórico. Mantenha o volume de mensagens baixo e pessoal, e saiba que você está aceitando algum risco ao usar uma automação não oficial — isso não é uma integração oficialmente sancionada.
Esse bot do WeChat funciona no Mac?
Não nativamente. O WeChatFerry exige Windows e se conecta ao cliente WeChat para Windows via injeção de DLL. Usuários de macOS podem rodar o Windows em uma máquina virtual (Parallels ou VMware Fusion) para usar essa configuração, com complexidade adicional.
Minha conta do WeChat pode ser banida por usar um bot?
Os termos de uso do WeChat proíbem bots automatizados. Contas detectadas usando ferramentas de automação correm o risco de suspensão temporária ou banimento permanente. Use isso apenas em baixo volume de mensagens para produtividade pessoal — o risco de conta é real, e isso não é uma integração oficialmente sancionada.
Qual é o melhor modelo do Ollama para mensagens do WeChat em chinês?
Para a maioria dos usuários, o Qwen3 8B oferece o melhor equilíbrio entre qualidade e velocidade — boa compreensão do chinês, e o modelo de cerca de 4,7 GB (Q4) cabe em 8 GB de VRAM ou roda em ritmo aceitável com 16 GB de RAM na CPU.
O bot consegue lidar com chats em grupo?
Sim. O WeChatFerry expõe mensagens de grupo junto com um ID de sala. Filtre via msg.roomid em quais grupos o bot deve responder, e exija uma palavra-chave de gatilho explícita (ex.: "@ai") para que ele não responda a toda mensagem do grupo.
De que hardware eu realmente preciso para este projeto?
Para um assistente leve com Qwen3 3B, qualquer PC Windows moderno com 16 GB de RAM já basta — um mini PC N150 econômico como o GMKtec G3 Plus cobre isso. Para o Qwen3 8B parecer responsivo e para operação 24/7 permanente, 32 GB de RAM e uma CPU classe Ryzen são o melhor investimento — nossa escolha para esse nível é o Minisforum UM890 Pro (no Brasil, a partir de cerca de R$ 3.900 importado).
O Minisforum UM890 Pro é superdimensionado para um bot do WeChat?
Para um bot simples do WeChat com Qwen3 3B, sim — uma máquina N150 econômica basta e custa uma fração do preço. Para um servidor de IA local de uso geral com 32–96 GB de RAM, vários modelos, RAG e outros serviços além do bot, o UM890 Pro fica muito mais fácil de justificar.
A inferência de LLM local torna o WeChat privado?
Não, e essa distinção é importante. A inferência local significa que o conteúdo das suas mensagens não é enviado a um provedor de LLM na nuvem de terceiros para processamento. Ela não transforma o WeChat em si em uma plataforma de comunicação privada — o WeChat continua rodando pela própria infraestrutura da Tencent, não importa onde o modelo de IA rode.
Essa é uma integração oficial do WeChat?
Não. O WeChatFerry é uma abordagem de automação/integração não oficial, não uma API oficial de bots do WeChat. Use com cautela, mantenha o volume de mensagens baixo e pessoal, e esteja ciente do risco de conta que acompanha qualquer automação não oficial.
