Points clés
- WeChatFerry + Ollama + Qwen3 est la pile qui fonctionne en 2026 pour un assistant WeChat avec LLM local — Windows uniquement, aucune API cloud
- Achetez le matériel pour l'usage réel visé : un boîtier N150 économique (GMKtec G3 Plus, à partir de 170 €) suffit pour un assistant léger Qwen3 3B
- Pour un serveur IA local permanent qui dépasse un simple bot, le Minisforum UM890 Pro (à partir d'env. 470 € barebone / env. 630 € avec 32 Go) est le meilleur investissement — environ 3 à 4 fois le prix, mais une autre classe de marge
- Qwen3 8B est le modèle de départ recommandé pour la qualité en chinois ; l'installation prend environ 30 à 60 minutes pour quelqu'un à l'aise avec Python
- Risque réel : les conditions d'utilisation de WeChat interdisent les bots automatisés — ceci relève de la productivité personnelle, pas d'un outil d'envoi massif
- Argument de confidentialité, formulé précisément : le contenu des messages ne va pas vers une API LLM cloud — WeChat lui-même continue de fonctionner via l'infrastructure de Tencent
- Prenez un mini-PC N150 économique (GMKtec G3 Plus ou Beelink EQ14) si : l'assistant WeChat est votre seule charge d'IA locale sérieuse, un modèle Qwen3 3B vous suffit, et une faible consommation en fonctionnement 24/7 compte plus que la vitesse.
- Prenez un boîtier Ryzen (Minisforum UM890 Pro) si : vous voulez que Qwen3 8B ou 14B soit réactif, vous prévoyez d'ajouter du RAG, une recherche documentaire ou d'autres services locaux plus tard, ou vous voulez une vraie marge plutôt qu'un second achat.
- Ne montez pas ce projet si : vous devez le faire tourner nativement sous macOS/Linux (WeChatFerry est exclusivement Windows), vous n'acceptez pas le risque de compte d'une intégration non officielle, ou vous avez besoin d'un volume de messages dépassant l'usage personnel.
- Une configuration économique (16 Go de RAM, tout CPU moderne) suffit vraiment pour un assistant léger à faible volume — ne surinvestissez pas pour cet usage.
- Le niveau recommandé (32 Go, CPU classe Ryzen) est le bon choix pour la plupart de ceux qui veulent un vrai assistant personnel — Qwen3 8B y tourne confortablement à côté du pont WeChat et d'Ollama lui-même.
- Le niveau poussé s'adresse aux lecteurs dont l'objectif réel est un serveur IA local généraliste, où le bot WeChat n'est qu'une interface parmi d'autres — RAG, recherche documentaire et services multiples ont besoin de la marge supplémentaire, pas le bot lui-même.
Niveau | RAM | Modèle adapté | Idéal pour |
|---|---|---|---|
| Économique | 16 Go | Qwen3 3B | Tester le concept, faible volume d'usage personnel, réponses simples en chinois |
| Recommandé | 32 Go | Qwen3 8B | La plupart des installations sérieuses — historique plus long, 24/7, réponses plus rapides |
| IA locale poussée | 64 Go+ | Qwen3 14B et plus | Plusieurs utilisateurs, RAG, recherche documentaire, agents IA |
- La marge de RAM est la vraie raison de ce choix, pas seulement la vitesse du CPU. Un serveur IA local a besoin de mémoire pour le système d'exploitation, Ollama, le modèle lui-même, l'historique de conversation et — si vous l'ajoutez plus tard — les embeddings et une base de données. Un plafond de 96 Go laisse une vraie marge de croissance ; un boîtier N150 économique plafonne bien plus bas.
- Deux emplacements SSD permettent de dédier l'un au système et aux applications, et le second aux modèles et aux données — utile dès que plus d'un service IA local tourne.
- Le double 2,5GbE est inutile pour un simple bot WeChat, mais utile si la machine devient plus tard un serveur local plus large sur votre réseau.
- L'inconvénient honnête : vous n'avez pas besoin d'une machine aussi puissante pour Qwen3 3B ou un usage léger en 8B. Si « je veux un bot WeChat pas cher » est tout l'objectif, c'est surdimensionné — voir l'option économique ci-dessous. Si l'objectif est « un serveur IA local permanent qui commence par WeChat et peut grandir », le UM890 Pro est la dépense la plus défendable.
- Choisissez une machine N150 si : le prix compte le plus, un modèle Qwen3 3B suffit vraiment pour votre usage, vous voulez une très faible consommation, et la machine doit aussi faire tourner Home Assistant ou d'autres services légers.
- Choisissez plutôt le UM890 Pro si : l'IA locale est la charge principale, vous voulez que Qwen3 8B+ soit réactif, vous voulez 32 Go+ de RAM, ou vous prévoyez de faire tourner du RAG ou plusieurs services IA locaux sur la même machine.
- Voir le test complet du GMKtec G3 Plus et le test du Beelink EQ14 pour les spécifications complètes, ou le comparatif des meilleurs mini-PC pour l'IA locale pour d'autres options.
- 1Installer Ollama et télécharger Qwen3 8B
Why it matters: Téléchargez Ollama depuis ollama.com et exécutez : `ollama pull qwen3:8b` - 2Se connecter à WeChat PC
Why it matters: Ouvrez WeChat sous Windows et scannez le QR code pour vous connecter. Gardez-le connecté et actif en arrière-plan. - 3Installer WeChatFerry
Why it matters: Installation via pip : `pip install wcferry`. WeChatFerry s'injecte dans le processus WeChat pour exposer une API de messages — vérifiez sur GitHub la version de WeChat actuellement prise en charge avant de continuer. - 4Créer le pont de messages Python
Why it matters: Créez `wechat_bot.py` avec un client WeChatFerry, des appels à l'API HTTP d'Ollama et la logique de routage, y compris la vérification du mot-clé déclencheur. - 5Tester avec un message à soi-même
Why it matters: Envoyez-vous un message WeChat commençant par « @ai » et vérifiez que le bot répond en environ 10 à 15 secondes sur CPU. - 6Ajouter la mémoire de conversation
Why it matters: Stockez les 10 à 20 derniers messages par contact pour permettre un contexte de conversation multi-tours. - 7Exécuter en tant que service en arrière-plan
Why it matters: Utilisez NSSM (Non-Sucking Service Manager) pour exécuter le script Python comme service Windows démarrant automatiquement, afin que le bot survive aux redémarrages.
- Qwen3:8b est le premier modèle sensé pour la plupart des utilisateurs — assez de capacité pour la conversation en chinois, le résumé, la reformulation, les questions-réponses et des automatisations personnelles simples.
- Ne choisissez pas un modèle uniquement parce que le fichier « tient » en RAM — tenir ne veut pas dire rapide. Pour un assistant conversationnel, la latence compte ; un modèle qui charge techniquement mais répond en 20 secondes et plus donne une impression cassée dans une appli de chat.
- Sur du matériel CPU uniquement (une machine N150), attendez-vous à une génération nettement plus lente que ces chiffres pour un modèle 8B+ — c'est exactement l'écart que comble le Minisforum UM890 Pro.
Modèle | Taille approx. (Q4) | Qualité en chinois | Vitesse (CPU) | Vitesse (8 Go VRAM) |
|---|---|---|---|---|
| Qwen3:3b | ~2 Go | Bonne | 8–12 tok/s | 60+ tok/s |
| Qwen3:8b | ~4,7 Go | Excellente — meilleur point de départ | 3–5 tok/s | 30–45 tok/s |
| Qwen3:14b | ~9 Go | Meilleure | 1–2 tok/s | 15–20 tok/s |
| Llama3.1:8b | ~4,7 Go | Moyenne | 3–5 tok/s | 30–45 tok/s |
- RAG local : poser des questions sur vos propres documents sans qu'ils quittent votre réseau.
- Base de connaissances personnelle : rechercher dans vos notes, PDF et informations enregistrées via la même interface WeChat.
- Automatisation : déclencher des scripts et des services locaux depuis un message WeChat.
- Home Assistant : envoyer des commandes à votre maison connectée — voir Connecter Ollama à Home Assistant.
- Tâches planifiées : générer des résumés ou rapports quotidiens.
- Cela transforme le projet de « un bot WeChat » en un serveur IA local privé avec WeChat comme une des interfaces — voir Agents IA locaux avec MCP pour la suite.
- L'affirmation précise et défendable : l'inférence LLM locale signifie que le contenu que vous envoyez à votre assistant n'est pas transmis à un fournisseur LLM cloud tiers pour traitement. C'est un vrai bénéfice de confidentialité, concret.
- Ce que cette configuration NE garantit PAS : que vos communications WeChat en général sont privées, ou que Tencent ne peut pas voir les métadonnées ou le contenu des messages via sa propre plateforme — c'est une question distincte que ce projet ne change pas.
- Windows uniquement : WeChatFerry utilise l'injection DLL Windows pour s'accrocher au processus WeChat. Cela ne fonctionne pas nativement sous macOS ou Linux ; faire tourner Windows dans une VM (Parallels, VMware Fusion) est un contournement possible, avec une complexité supplémentaire.
- Dépendance à la version du client WeChat : WeChatFerry suit des versions précises du client PC WeChat (actuellement 3.9.12.17). Vérifiez la liste de compatibilité sur le dépôt GitHub de WeChatFerry avant de mettre à jour WeChat, sinon le bot peut cesser de fonctionner silencieusement.
- Latence : l'inférence CPU seule sur un modèle 8B prend environ 5 à 15 secondes par réponse, ce qui peut sembler lent dans un contexte de chat. Un GPU classe 8 Go ou un iGPU Ryzen réduit cela nettement.
- Le risque sur le compte est réel, pas théorique. Gardez le volume de messages faible et personnel, et sachez que vous acceptez un certain risque en utilisant une automatisation non officielle — ce n'est pas une intégration officielle sanctionnée.
Ce bot WeChat fonctionne-t-il sur Mac ?
Pas nativement. WeChatFerry nécessite Windows et s'accroche au client PC WeChat Windows via injection DLL. Les utilisateurs macOS peuvent faire tourner Windows dans une machine virtuelle (Parallels ou VMware Fusion) pour utiliser cette configuration, avec une complexité supplémentaire.
Mon compte WeChat risque-t-il d'être banni en utilisant un bot ?
Les conditions d'utilisation de WeChat interdisent les bots automatisés. Les comptes détectés utilisant des outils d'automatisation risquent une suspension temporaire ou un bannissement permanent. Réservez ceci à la productivité personnelle à faible volume de messages — le risque sur le compte est réel, et ceci n'est pas une intégration officiellement sanctionnée.
Quel est le meilleur modèle Ollama pour les messages WeChat en chinois ?
Qwen3 8B offre le meilleur équilibre qualité/vitesse pour la plupart des utilisateurs — bonne compréhension du chinois, et le modèle d'environ 4,7 Go (Q4) tient dans 8 Go de VRAM ou tourne à un rythme acceptable avec 16 Go de RAM CPU.
Le bot peut-il gérer les discussions de groupe ?
Oui. WeChatFerry expose les messages de groupe avec un identifiant de salon. Filtrez via msg.roomid les groupes où le bot doit répondre, et exigez un mot-clé déclencheur explicite (ex. « @ai ») pour qu'il ne réponde pas à chaque message de groupe.
De quel matériel ai-je vraiment besoin pour ce projet ?
Pour un assistant léger Qwen3 3B, tout PC Windows moderne avec 16 Go de RAM suffit — un mini-PC N150 économique comme le GMKtec G3 Plus (à partir de 170 €) couvre ce besoin. Pour que Qwen3 8B soit réactif et pour un fonctionnement 24/7 permanent, 32 Go de RAM et un CPU classe Ryzen sont le meilleur investissement — notre choix pour ce niveau est le Minisforum UM890 Pro (à partir d'env. 470 € barebone / env. 630 € avec 32 Go).
Le Minisforum UM890 Pro est-il surdimensionné pour un bot WeChat ?
Pour un simple bot WeChat avec Qwen3 3B, oui — un boîtier N150 économique suffit et coûte environ un tiers du prix. Pour un serveur IA local généraliste avec 32 à 96 Go de RAM, plusieurs modèles, du RAG et d'autres services en parallèle du bot, le UM890 Pro est bien plus facile à justifier.
L'inférence LLM locale rend-elle WeChat privé ?
Non, et cette distinction est importante. L'inférence locale signifie que le contenu de vos messages n'est pas envoyé à un fournisseur LLM cloud tiers pour traitement. Elle ne fait pas de WeChat lui-même une plateforme de communication privée — WeChat continue de fonctionner via sa propre infrastructure Tencent, quel que soit l'endroit où tourne le modèle d'IA.
Est-ce une intégration WeChat officielle ?
Non. WeChatFerry est une approche d'automatisation/intégration non officielle, pas une API bot WeChat officielle. Utilisez-la avec prudence, gardez un volume de messages faible et personnel, et soyez conscient du risque de compte lié à toute automatisation non officielle.
Comment créer un bot WeChat avec un LLM local ?
Utilisez WeChatFerry (Windows) pour vous accrocher au client PC WeChat, connectez-le à Ollama via son API HTTP locale, et acheminez les messages vers un modèle Qwen3. Installation : environ 30 à 60 minutes avec Python.
