Conclusiones clave
- WeChatFerry + Ollama + Qwen3 es la combinación que funciona en 2026 para un asistente de WeChat con LLM local — solo Windows, sin ninguna API en la nube
- Compra el hardware según la tarea real: un equipo N150 económico (GMKtec G3 Plus, desde ~170 €/$140–200) basta para un asistente ligero con Qwen3 3B
- Para un servidor de IA local siempre activo que crezca más allá de un bot simple, el Minisforum UM890 Pro (desde ~470 €/$439–649) es mejor inversión — unas 3–4 veces el precio, pero otra clase de margen
- Qwen3 8B es el modelo de partida recomendado para calidad en chino; la instalación toma entre 30 y 60 minutos para alguien cómodo con Python
- Riesgo real: los términos de servicio de WeChat prohíben los bots automatizados — esto es un uso de productividad personal, no una herramienta de envío masivo
- Afirmación de privacidad, formulada con precisión: el contenido de los mensajes no va a una API de LLM en la nube — WeChat en sí sigue funcionando a través de la infraestructura de Tencent
- Compra un mini PC N150 económico (GMKtec G3 Plus o Beelink EQ14) si: el asistente de WeChat es tu única carga seria de IA local, un modelo Qwen3 3B te resulta suficiente, y el bajo consumo en funcionamiento 24/7 importa más que la velocidad.
- Compra un equipo de clase Ryzen (Minisforum UM890 Pro) si: quieres que Qwen3 8B o 14B se sienta ágil, planeas añadir RAG, búsqueda de documentos u otros servicios locales más adelante, o quieres margen real en vez de comprar dos veces.
- Salta este proyecto por completo si: necesitas ejecutarlo de forma nativa en macOS/Linux (WeChatFerry es solo para Windows), no estás dispuesto a aceptar el riesgo de cuenta de una integración no oficial, o necesitas un volumen de mensajes que supere el uso personal.
- Una configuración económica (16 GB de RAM, cualquier CPU moderna) es realmente suficiente para un asistente pequeño de bajo volumen — no gastes de más para este uso.
- El nivel recomendado (32 GB, CPU de clase Ryzen) es donde debería situarse la mayoría de quienes quieren construir un asistente personal real — Qwen3 8B funciona cómodamente ahí junto al puente de WeChat y al propio Ollama.
- El nivel intensivo es para lectores cuyo objetivo real es un servidor de IA local de propósito general, donde el bot de WeChat es solo una interfaz entre varias — RAG, búsqueda de documentos y múltiples servicios necesitan ese margen extra, no el bot en sí.
| Nivel | RAM | Modelo que soporta | Ideal para |
|---|---|---|---|
| Económico | 16 GB | Qwen3 3B | Probar el concepto, uso personal de bajo volumen, respuestas sencillas en chino |
| Recomendado | 32 GB | Qwen3 8B | La mayoría de instalaciones serias — más historial, uso 24/7, respuestas más ágiles |
| IA local intensiva | 64 GB+ | Qwen3 14B y mayores | Varios usuarios simultáneos, RAG, búsqueda de documentos, flujos de agentes, servicios de IA local adicionales |
- El margen de RAM es la razón real para elegirlo, no solo la velocidad de la CPU. Un servidor de IA local necesita memoria para el sistema operativo, Ollama, el modelo en sí, el historial de conversación y — si lo añades más adelante — embeddings y una base de datos. Un techo de 96 GB da margen real para crecer; un equipo N150 económico se queda muy por debajo.
- Dos ranuras SSD permiten dedicar una al sistema y las aplicaciones, y la segunda a modelos y datos — algo relevante en cuanto ejecutas más de un servicio de IA local.
- La red doble de 2,5GbE es innecesaria para un bot de WeChat sencillo, pero útil si la máquina acaba convirtiéndose en un servidor local más amplio en tu red.
- La desventaja honesta: no necesitas tanta máquina para Qwen3 3B o un uso ligero de 8B. Si "quiero un bot de WeChat barato" es todo el objetivo, esto es excesivo — mira la opción económica más abajo. Si el objetivo es "un servidor de IA local siempre activo que empieza con WeChat y puede crecer", el UM890 Pro es el gasto más defendible.
- Elige una máquina N150 si: el precio es lo más importante, un modelo Qwen3 3B te resulta realmente suficiente, quieres un consumo muy bajo, y la máquina también va a ejecutar Home Assistant u otros servicios ligeros.
- Elige en su lugar el UM890 Pro si: la IA local es la carga principal, quieres que Qwen3 8B o superior se sienta ágil, quieres 32 GB+ de RAM, o planeas ejecutar RAG o varios servicios de IA local en la misma máquina.
- Consulta la reseña completa del GMKtec G3 Plus y la reseña del Beelink EQ14 para las especificaciones completas, o el comparativo de los mejores mini PC para IA local para más opciones.
- 1Instalar Ollama y descargar Qwen3 8B
Why it matters: Descarga Ollama desde ollama.com y ejecuta: `ollama pull qwen3:8b` - 2Iniciar sesión en WeChat para PC
Why it matters: Abre WeChat en Windows y escanea el código QR para iniciar sesión. Mantenlo conectado y en ejecución en segundo plano. - 3Instalar WeChatFerry
Why it matters: Instálalo con pip: `pip install wcferry`. WeChatFerry se inyecta en el proceso de WeChat para exponer una API de mensajes — comprueba en GitHub qué versión de WeChat es compatible actualmente antes de continuar. - 4Crear el gestor de mensajes en Python
Why it matters: Crea `wechat_bot.py` con un cliente de WeChatFerry, llamadas a la API HTTP de Ollama y la lógica de enrutamiento, incluida la comprobación de la palabra clave de activación. - 5Probar con un mensaje a ti mismo
Why it matters: Envíate un mensaje de WeChat que empiece por "@ai" y comprueba que el bot responde en unos 10–15 segundos en CPU. - 6Añadir memoria de conversación
Why it matters: Guarda los últimos 10–20 mensajes por contacto para permitir contexto de conversación de varios turnos. - 7Ejecutarlo como servicio en segundo plano
Why it matters: Usa NSSM (Non-Sucking Service Manager) para ejecutar el script de Python como un servicio de Windows que se inicia automáticamente, de modo que el bot sobreviva a los reinicios.
- Qwen3:8b es el primer modelo sensato para la mayoría de usuarios — suficiente capacidad para conversación en chino, resúmenes, reescritura, preguntas y respuestas, y automatizaciones sencillas de productividad personal.
- No elijas un modelo solo porque el archivo "cabe" en la RAM — caber no significa rápido. En un asistente conversacional, la latencia de respuesta importa; un modelo que técnicamente carga pero responde en 20 segundos o más se siente roto en una app de chat.
- En hardware solo con CPU (un equipo N150), espera una generación notablemente más lenta que estas cifras para un modelo de 8B o más — exactamente el hueco que cubre el Minisforum UM890 Pro.
| Modelo | Tamaño aprox. (Q4) | Calidad en chino | Velocidad (CPU) | Velocidad (8 GB VRAM) |
|---|---|---|---|---|
| Qwen3:3b | ~2 GB | Buena | 8–12 tok/s | 60+ tok/s |
| Qwen3:8b | ~4,7 GB | Excelente — mejor punto de partida | 3–5 tok/s | 30–45 tok/s |
| Qwen3:14b | ~9 GB | La mejor | 1–2 tok/s | 15–20 tok/s |
| Llama3.1:8b | ~4,7 GB | Moderada | 3–5 tok/s | 30–45 tok/s |
- RAG local: haz preguntas sobre tus propios documentos sin que salgan de tu red.
- Base de conocimiento personal: busca en notas, PDF e información guardada a través de la misma interfaz de WeChat.
- Automatización: activa scripts y servicios locales desde un mensaje de WeChat.
- Home Assistant: envía comandos a tu hogar inteligente — consulta Conectar Ollama con Home Assistant.
- Tareas programadas: genera resúmenes o informes diarios.
- Esto convierte el proyecto de "un bot de WeChat" en un servidor de IA local privado con WeChat como una de sus interfaces — consulta Agentes de IA locales con MCP para el siguiente paso.
- La afirmación precisa y defendible: la inferencia de LLM local significa que el contenido que envías a tu asistente no se reenvía a un proveedor de LLM en la nube de terceros para su procesamiento. Ese es un beneficio de privacidad real y concreto.
- Lo que esta configuración NO respalda: que tus comunicaciones de WeChat en general sean privadas, o que Tencent no pueda ver los metadatos o el contenido de los mensajes a través de su propia plataforma — esa es una cuestión aparte que este proyecto no cambia.
- Solo Windows: WeChatFerry usa inyección de DLL en Windows para conectarse al proceso de WeChat. No funciona de forma nativa en macOS ni Linux; ejecutar Windows en una máquina virtual (Parallels, VMware Fusion) es una alternativa posible, con complejidad añadida.
- Dependencia de la versión del cliente de WeChat: WeChatFerry sigue versiones específicas del cliente de WeChat para PC (actualmente 3.9.12.17). Comprueba la lista de versiones compatibles en el repositorio de GitHub de WeChatFerry antes de actualizar WeChat, o el bot puede dejar de funcionar sin previo aviso.
- Latencia: la inferencia solo con CPU en un modelo de 8B tarda entre 5 y 15 segundos por respuesta, lo que puede sentirse lento en un contexto de chat. Una GPU de clase 8 GB o una iGPU de Ryzen reduce esto de forma notable.
- El riesgo de cuenta es real, no teórico. Mantén el volumen de mensajes bajo y personal, y ten en cuenta que estás asumiendo cierto riesgo al usar una automatización no oficial — no es una integración oficial ni sancionada.
¿Este bot de WeChat funciona en Mac?
No de forma nativa. WeChatFerry requiere Windows y se conecta al cliente de WeChat para Windows mediante inyección de DLL. Los usuarios de macOS pueden ejecutar Windows en una máquina virtual (Parallels o VMware Fusion) para usar esta configuración, con complejidad añadida.
¿Puede mi cuenta de WeChat ser bloqueada por usar un bot?
Los términos de servicio de WeChat prohíben los bots automatizados. Las cuentas detectadas usando herramientas de automatización corren el riesgo de suspensión temporal o bloqueo permanente. Úsalo solo con bajo volumen de mensajes para productividad personal — el riesgo de cuenta es real, y esto no es una integración oficialmente sancionada.
¿Cuál es el mejor modelo de Ollama para mensajes de WeChat en chino?
Para la mayoría de usuarios, Qwen3 8B ofrece el mejor equilibrio entre calidad y velocidad — buena comprensión del chino, y el modelo de unos 4,7 GB (Q4) cabe en 8 GB de VRAM o funciona a un ritmo aceptable con 16 GB de RAM en CPU.
¿Puede el bot gestionar chats grupales?
Sí. WeChatFerry expone los mensajes de grupo junto con el ID de la sala. Filtra mediante msg.roomid en qué grupos debe responder el bot, y exige una palabra clave de activación explícita (p. ej. "@ai") para que no responda a cada mensaje del grupo.
¿Qué hardware necesito realmente para este proyecto?
Para un asistente ligero con Qwen3 3B, cualquier PC Windows moderno con 16 GB de RAM es suficiente — un mini PC N150 económico como el GMKtec G3 Plus (desde ~170 €/$140–200) cubre esto. Para que Qwen3 8B se sienta ágil y para funcionamiento 24/7 permanente, 32 GB de RAM y una CPU de clase Ryzen son mejor inversión — nuestra elección para ese nivel es el Minisforum UM890 Pro (desde ~470 €/$439–649).
¿Es excesivo el Minisforum UM890 Pro para un bot de WeChat?
Para un bot de WeChat sencillo con Qwen3 3B, sí — un equipo N150 económico basta y cuesta aproximadamente un tercio. Para un servidor de IA local de propósito general con 32–96 GB de RAM, varios modelos, RAG y otros servicios además del bot, el UM890 Pro es mucho más fácil de justificar.
¿La inferencia de LLM local hace que WeChat sea privado?
No, y esta distinción es importante. La inferencia local significa que el contenido de tus mensajes no se envía a un proveedor de LLM en la nube de terceros para su procesamiento. No convierte a WeChat en sí en una plataforma de comunicación privada — WeChat sigue funcionando a través de su propia infraestructura de Tencent, sin importar dónde se ejecute el modelo de IA.
¿Es esta una integración oficial de WeChat?
No. WeChatFerry es un enfoque de automatización/integración no oficial, no una API oficial de bots de WeChat. Úsalo con precaución, mantén el volumen de mensajes bajo y personal, y sé consciente del riesgo de cuenta que conlleva cualquier automatización no oficial.
