Skip to main content
PromptQuorumBuilt for humans. Structured for AI.
Accueil/LLM locaux avancés/WeChat + LLM local : Guide développeur 2026
Local AI Agents & Tool Use

WeChat + LLM local : Guide développeur 2026

·11 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum · Moteur de découverte de l'IA open-weight et open source

Connectez WeChat à un LLM local en exécutant Ollama sur un mini PC, en installant WeChatFerry pour intercepter les messages WeChat PC, et en écrivant un bridge Python vers l'API HTTP Ollama. Recommandé : Qwen3 8B Q4_K_M pour les conversations en chinois.

Connecter WeChat à un LLM local offre un assistant IA privé dans l'application de messagerie la plus utilisée au monde, sans envoyer un seul message à une API cloud. Ce guide couvre trois patterns d'intégration, le choix du modèle pour le texte chinois, et la conformité RGPD et DSL chinoise.

Présentation: WeChat + LLM local : Guide développeur 2026

Diaporama interactif pour cet article.

Parcourez les diapositives ci-dessous ou téléchargez en PDF. Télécharger la fiche de référence (PDF)

WeChat + LLM local : Guide développeur 2026

Points clés

  • WeChatFerry (Windows) est le hook WeChat PC le plus fiable en 2026
  • Ollama expose une API HTTP locale sur le port 11434 — 10 lignes de Python suffisent
  • Qwen3 8B Q4_K_M : recommandé pour le chat en chinois — 6 Go VRAM, tokenisation CJK native
  • Mini PC always-on (Minisforum UM890 Pro, ~35 W) pour un bot disponible 24/7
  • Inférence locale : zéro donnée transmise vers le cloud — conformité RGPD Art. 28

Trois patterns d'intégration WeChat + LLM

Pattern 1 — WeChatFerry + Ollama (Windows) : Le plus stable. WeChatFerry intercepte le client WeChat PC et expose un SDK Python. Fonctionne pour les chats personnels et de groupe.

Pattern 2 — Pont HTTP webhook : Multiplateforme, plus complexe. Adapté aux entreprises avec infrastructure WeChat Official Account.

Pattern 3 — Ollama + Open WebUI : Option la plus simple pour des notifications unidirectionnelles. Aucun hook requis.

Pour la plupart des utilisateurs — notamment en Chine avec un compte personnel — le pattern 1 (WeChatFerry + Ollama) est le bon choix pour 2026.

Flux de message WeChat + LLM local : WeChatFerry intercepte le client WeChat PC, un pont Python transmet les messages à Ollama sur localhost:11434, et Qwen3 8B Q4_K_M renvoie une réponse en 2–5 secondes — entièrement sur matériel local, sans appel API cloud.
Flux de message WeChat + LLM local : WeChatFerry intercepte le client WeChat PC, un pont Python transmet les messages à Ollama sur localhost:11434, et Qwen3 8B Q4_K_M renvoie une réponse en 2–5 secondes — entièrement sur matériel local, sans appel API cloud.

Configuration WeChatFerry : étape par étape

  1. 1
    Installer sur Windows le build WeChat PC 3.9.12.x correspondant à votre version de WeChatFerry — WeChatFerry cible des builds 3.9.x précis et ne prend pas en charge le client WeChat 4.x actuel
  2. 2
    Installer WeChatFerry : pip install wcferry (Python 3.10+)
  3. 3
    Démarrer le daemon : python -m wcferry.daemon
  4. 4
    Écrire le gestionnaire de messages : from wcferry import Wcf; wcf = Wcf(); wcf.enable_receiving_msg()
  5. 5
    Dans la boucle de messages, envoyer un POST à Ollama : requests.post("http://localhost:11434/api/generate", json={"model":"qwen3:8b","prompt":msg.content})
  6. 6
    Envoyer la réponse : `wcf.send_text(response["response"], msg.roomid or msg.sender)`
  7. 7
    Tester avec un message personnel ; vérifier que la réponse apparaît dans WeChat en 2–5 secondes
python
import requests
from wcferry import Wcf

wcf = Wcf()
wcf.enable_receiving_msg()

while True:
    msg = wcf.get_msg()
    if msg and msg.from_self() is False:
        resp = requests.post(
            "http://localhost:11434/api/generate",
            json={"model": "qwen3:8b", "prompt": msg.content, "stream": False}
        ).json()
        wcf.send_text(resp["response"], msg.roomid or msg.sender)

API HTTP Ollama : points de terminaison clés

Ollama expose un serveur REST local sur http://localhost:11434 après ollama serve. Aucune authentification requise pour les connexions locales.

Génération (tour unique) : POST /api/generate — corps : {model, prompt, stream: false} — retourne {response, done}

Chat (multi-tours) : POST /api/chat — corps : `{model, messages: [{role, content}]}` — conserve le contexte de conversation entre les appels

Lister les modèles : GET /api/tags — retourne tous les modèles installés avec leur taille

Pour l'intégration WeChat, utiliser /api/chat avec un historique glissant (10 derniers messages) pour conserver le contexte pendant une session.

Mini PC comme serveur WeChat LLM always-on

Un mini PC dédié et toujours allumé maintient votre bot WeChat en ligne sans mobiliser un laptop ou une station de travail.

Minisforum UM890 Pro (Recommandé) : AMD Ryzen 9 8945HS, 32–64 Go DDR5. ~8 tok/s sur Qwen3 8B. Consommation : ~35 W en veille. Prix : environ 320–420 €.

Mac Mini M6 : Apple Silicon M6, 16–32 Go RAM unifiée, pas encore testé indépendamment. Consommation : moins de 5 W au repos. Prix : à partir de 1 049 €.

Astuce : activez le démarrage automatique — ajoutez ollama serve et le script de pont WeChatFerry à systemd (Linux) ou au Planificateur de tâches Windows. Le bot redémarre ainsi seul après une coupure de courant.

Meilleurs modèles pour le chat WeChat en chinois

Qwen3 8B Q4_K_M (Premier choix) : Développé par Alibaba avec tokenisation CJK native. 6 Go VRAM, 8–15 tok/s. Installation : ollama pull qwen3:8b.

Qwen3 14B Q4_K_M : Pour des conversations plus riches avec 12–16 Go de RAM disponible.

DeepSeek-R1-0528-Qwen3-8B : Efficace pour les questions-réponses et les explications pas à pas en chinois. Légèrement moins bon que Qwen3 8B en conversation informelle.

À éviter : Llama 3 et Mistral — tokeniseurs occidentaux, 2–3× plus de tokens pour le texte chinois.

Tokenisation du texte chinois par modèle : Qwen3 8B a besoin de 42 tokens pour une phrase de 50 caractères contre 98 pour Llama 3 et 115 pour Mistral — la tokenisation CJK native réduit le nombre de tokens de 2,3–2,7×.
Tokenisation du texte chinois par modèle : Qwen3 8B a besoin de 42 tokens pour une phrase de 50 caractères contre 98 pour Llama 3 et 115 pour Mistral — la tokenisation CJK native réduit le nombre de tokens de 2,3–2,7×.

Gestion des chats de groupe

Les chats de groupe WeChat nécessitent la gestion des mentions @. WeChatFerry expose msg.is_at.

Bonne pratique : répondre uniquement quand msg.is_at est True ou lors d'un mot déclencheur. Maintenir des historiques séparés par utilisateur (msg.sender).

Limite de débit : WeChat peut restreindre les comptes envoyant plus de ~30 messages par minute. Ajoutez un délai de 2–3 secondes entre les réponses du bot en groupe.

Confidentialité & conformité RGPD

L'inférence locale signifie que les prompts, réponses et historiques ne quittent jamais votre matériel.

RGPD Art. 28 : Les LLM locaux évitent le besoin d'un accord de traitement des données avec un fournisseur LLM.

Recommandation CNIL : La CNIL recommande de privilégier les traitements locaux pour les données professionnelles sensibles (financières, médicales, juridiques) — l'inférence locale répond directement à cette recommandation.

Ce que cela ne couvre PAS : Les métadonnées des messages WeChat restent sur les serveurs Tencent.

Questions fréquentes

WeChatFerry fonctionne-t-il avec WeChat pour Mac ?

Non. WeChatFerry ne supporte que le client WeChat PC sur Windows.

Tencent peut-il bannir mon compte pour l'utilisation d'un bot ?

Les bots personnels avec des taux de réponse humains (1–5 messages/min) déclenchent rarement des bannissements.

Quel modèle Ollama pour le chinois ?

Qwen3 8B Q4_K_M — tokenisation CJK native, 30–40% plus efficace que Llama ou Mistral.

Puis-je utiliser un laptop ?

Oui. 16 Go RAM suffit pour Qwen3 8B en mode CPU-only, 8–15 tok/s.

Conformité RGPD avec un LLM local ?

Les LLM locaux évitent les accords DPA avec les fournisseurs cloud. Les métadonnées WeChat restent chez Tencent.

Comment gérer les conversations multi-tours ?

Maintenir l'historique comme liste de dicts {role, content} par expéditeur, transmettre les 10–15 derniers messages à /api/chat.

WeChatFerry prend-il en charge WeChat 4.x ?

Non. WeChatFerry cible uniquement des builds WeChat PC 3.9.12.x précis. Le client WeChat 4.x repose sur une architecture réécrite sans hook stable : conservez le build 3.9.12.x correspondant sur la machine du bot et désactivez les mises à jour automatiques.

Lecture connexe

← Retour aux LLM locaux avancés