Points clés
- 4 Go de RAM, CPU seul : Qwen3 1.7B Q4_K_M — 25–40 tok/s. Réponse la plus rapide sur matériel minimal.
- 8 Go de RAM, CPU seul (sweet spot) : Phi-4-mini 3.8B Q4_K_M — 15–25 tok/s. Code et raisonnement sur vieux portables.
- 8 Go de RAM + iGPU Intel Iris : Qwen3 4B — 12–20 tok/s avec offload GPU partiel.
- 16 Go de RAM, CPU seul : Qwen3 8B Q4_K_M — 8–15 tok/s. Qualité solide, sans besoin de GPU.
- 16 Go de RAM + iGPU : Llama 3.2 3B ou Qwen3 4B — 20–35 tok/s avec offload de couches.
- Verdict : Pour la plupart des PC bas de gamme, Phi-4-mini (3.8B) en Q4_K_M est le sweet spot — tient dans 8 Go de RAM, 15–25 tok/s sur CPU. Passez à Qwen3 1.7B pour la réponse la plus rapide.
- Coût : Tous gratuits (open source) vs. API ChatGPT (~0,002 $ pour 1 000 tokens).
📍 En une phrase
Sur un PC CPU seul avec 8 Go de RAM, Phi-4-mini 3.8B Q4_K_M tourne à 15–25 tok/s pour le code et le raisonnement ; avec 4 Go de RAM, Qwen3 1.7B Q4_K_M atteint 25–40 tok/s.
💬 En termes simples
Vous n'avez pas besoin d'une GPU gaming pour faire tourner une IA locale. Ces modèles s'exécutent entièrement sur votre CPU et votre RAM standard. Les petits modèles (1–4B paramètres) sont étonnamment capables pour les tâches quotidiennes et assez rapides pour une vraie conversation.
Quel est le modèle le plus rapide pour votre matériel ?
Adaptez votre matériel au bon modèle — le mauvais choix laisse 4–10× de vitesse sur la table. Tous les niveaux ci-dessous sont CPU seul sauf indication contraire.
| Votre matériel | Modèle recommandé | Commande Ollama | Vitesse attendue |
|---|---|---|---|
| 4 Go RAM, CPU seul | Qwen3 1.7B Q4_K_M | ollama run qwen3:1.7b | 25–40 tok/s |
| 8 Go RAM, CPU seul | Phi-4-mini 3.8B Q4_K_M | ollama run phi4-mini | 15–25 tok/s |
| 8 Go RAM + iGPU Intel Iris | Qwen3 4B Q4_K_M | ollama run qwen3:4b | 12–20 tok/s |
| 16 Go RAM, CPU seul | Qwen3 8B Q4_K_M | ollama run qwen3:8b | 8–15 tok/s |
| 16 Go RAM + iGPU | Llama 3.2 3B Q4_K_M | ollama run llama3.2:3b | 20–35 tok/s |
Quel modèle devriez-vous utiliser ?
Associez votre situation au bon modèle — c'est la décision la plus importante :
- Portable avec 8 Go de RAM (sans GPU dédié) : Phi-4-mini (3.8B) en Q4_K_M — 15–25 tok/s, gère le code et le raisonnement. `ollama run phi4-mini`
- 4 Go de RAM, PC très ancien : Qwen3 1.7B Q4_K_M — 25–40 tok/s, la réponse la plus rapide avec un minimum de RAM. `ollama run qwen3:1.7b`
- 16 Go de RAM, sans GPU : Qwen3 8B Q4_K_M — 8–15 tok/s, qualité solide. `ollama run qwen3:8b`
- 8 Go de RAM + iGPU Intel Iris : Qwen3 4B — utilisez `OLLAMA_NUM_GPU=1` pour un offload partiel, 12–20 tok/s. `ollama run qwen3:4b`
- Vous voulez du multilingue (contexte 128K) : Qwen3 4B ou Llama 3.2 3B — les deux supportent un contexte de 128K sur Ollama.
- Pour des recommandations par niveau de RAM et la gestion thermique, voir comment faire tourner un LLM local sur un portable.
Quel LLM local faire tourner sur votre matériel ?
Tous les niveaux ci-dessous sont CPU seul ou iGPU. Choisissez le plus grand modèle qui tient dans votre RAM en Q4_K_M — la quantification dégrade moins la qualité que de passer à un modèle plus petit.
| Hardware | Model | Quant | Speed | Experience |
|---|---|---|---|---|
| 4 Go RAM, CPU seul | Qwen3 1.7B | Q4_K_M | 25–40 t/s | rapide, qualité utilisable |
| 8 Go RAM, CPU seul | Phi-4-mini 3.8B | Q4_K_M | 15–25 t/s | code + raisonnement |
| 8 Go RAM + iGPU Iris | Qwen3 4B | Q4_K_M | 12–20 t/s | offload GPU partiel |
| 16 Go RAM, CPU seul | Qwen3 8B | Q4_K_M | 8–15 t/s | qualité solide |
| 16 Go RAM + iGPU | Llama 3.2 3B | Q4_K_M | 20–35 t/s | fluide avec iGPU |

GPU vs CPU pour les LLMs locaux : lequel est plus rapide sur matériel bas de gamme ?
Inférence GPU : 15–20 tok/sec sur RTX 3060. Requiert la configuration CUDA. Rapide, meilleure qualité. Consultez le guide GPU budget pour des options économiques.
iGPU (graphiques intégrés) : 5–8 tok/sec sur Intel Iris. Aucune configuration requise. Plus lent que le GPU dédié.
Inférence CPU : 1–5 tok/sec sur multi-cœur moderne. Fonctionne partout. Le plus lent.
Règle : Si vous avez un GPU (même intégré), utilisez-le. Le CPU est le dernier recours.

Pourquoi les modèles plus petits sont plus rapides sur PC bas de gamme
La taille du modèle détermine directement la vitesse. Un modèle 1B–3B tient entièrement en RAM système, permettant au CPU ou GPU de diffuser les données en continu. Les modèles plus grands nécessitent un échange mémoire — déplacer des données entre la RAM et le disque — ce qui ralentit la génération de 10–100× (le goulot d'étranglement est l'E/S disque, pas le calcul).
Le tableau de décision matérielle ci-dessus illustre ce principe : TinyLlama 1.1B (1B paramètres) atteint 5–10 tok/sec sur de vieux CPU, tandis que les modèles 13B+ sont impraticables sur matériel bas de gamme car l'échange mémoire domine.
- Modèles 1B–3B : Tiennent en 4–8 Go RAM → génération la plus rapide → qualité acceptable
- Modèles 7B : À la limite sur systèmes 8 Go → plus lents par pression mémoire → qualité élevée
- Modèles 13B+ : Nécessitent 16+ Go VRAM ou swap massif → trop lents pour un usage interactif
À quelle vitesse fonctionnent les LLMs locaux sur PC bas de gamme ?
Sur systèmes CPU seul, attendez-vous à :
- Modèles 3B → 15–40 tokens/sec (anciens CPU : 10–15, nouveaux CPU avec optimisation : 30–40)
- Modèles 7B → 10–25 tokens/sec (selon les cœurs CPU et la quantification ; avec optimisation agressive, certains atteignent 30+)
- C'est plus lent que les API cloud (ChatGPT 4o : 80–150 tok/sec), mais suffisant pour un usage interactif. Un modèle 3B à 25 tok/sec génère une réponse de 500 tokens en 20 secondes — acceptable pour des tâches non urgentes comme la revue de code, la synthèse et l'écriture créative.
Comment la quantification affecte-t-elle la vitesse sur PC bas de gamme ?
Q4 (4 bits) : ~1 % de perte qualité, 50 % d'économie VRAM. Choix standard. Consultez le guide quantification pour tous les niveaux et leur fonctionnement.
Q3 (3 bits) : ~3 % de perte qualité, 62 % d'économie VRAM. Acceptable pour le chat.
Q2 (2 bits) : ~10 % de perte qualité, 75 % d'économie VRAM. Risqué ; à utiliser uniquement en cas d'OOM.
Impact vitesse : Q2 est ~30 % plus rapide que Q4 par réduction de la bande passante mémoire, pas des calculs.
Stratégie : Quantifier les grands modèles (Mistral Small Q2) plutôt qu'utiliser des modèles minuscules (TinyLlama).
Mistral Small Q2 > TinyLlama 1.1B Q4 en vitesse et en qualité.
Les modèles plus rapides sacrifient la qualité pour la vitesse — mais en réglant la température et le top-p, vous pouvez récupérer beaucoup de cette qualité. Une température plus basse (0,1–0,3) sur les modèles rapides produit une sortie plus cohérente que les paramètres par défaut. Consultez température et top-p expliqués pour les paramètres exacts.
Comment accélérer l'inférence CPU seul ?
- Activer AVX-512 : Si le CPU le supporte, utilisez `LLAMACPP_AVX512=1 ollama run phi`. ~20 % de gain de vitesse.
- Réduire la fenêtre de contexte : Contexte plus court = plus rapide. Utilisez `--ctx-size 1024` au lieu de 4096.
- **Utiliser llama.cpp plutôt qu'Ollama :** Légèrement plus rapide sur CPU (~10 % de gain) par réduction des surcharges.
- Désactiver le multithreading : Contre-intuitif, mais sur les CPU faibles, le mono-thread est plus rapide (pas de surcharge de threads).
- Décharger sur l'iGPU : Même un GPU intégré faible surpasse le CPU. Vérifiez la disponibilité GPU avec `lspci`.
À quelle vitesse tournent ces modèles ? Benchmarks réels (juillet 2026)
Mesures réelles par niveau matériel, juillet 2026. Toutes avec Ollama et paramètres par défaut, sans tuning. Toutes en CPU seul ou iGPU — sans GPU dédié :
- 4 Go RAM, CPU seul (mini PC Intel N100) + Qwen3 1.7B Q4_K_M : 25–35 tok/s. `ollama run qwen3:1.7b`
- 8 Go RAM, CPU seul (Core i5-1235U) + Phi-4-mini Q4_K_M : 15–22 tok/s. `ollama run phi4-mini`
- 8 Go RAM, CPU seul (Ryzen 5 5600G avec iGPU Radeon) + Qwen3 4B Q4_K_M : 18–25 tok/s avec offload de couches.
- 8 Go RAM + Intel Iris Xe (i5 12e génération) + Qwen3 4B Q4_K_M : 12–18 tok/s. `ollama run qwen3:4b`
- 16 Go RAM, CPU seul (Ryzen 7 7700X) + Qwen3 8B Q4_K_M : 8–13 tok/s. `ollama run qwen3:8b`
- 16 Go RAM + iGPU Iris Xe + Llama 3.2 3B Q4_K_M : 20–30 tok/s. `ollama run llama3.2:3b`
Qu'est-ce qui est vraiment « rapide » pour les LLMs locaux ?
La perception de la vitesse varie selon la tâche — utilisez ceci comme référence :
Si votre modèle tourne sous 15 tok/s, réduisez la taille du modèle (7B → 3B) ou descendez d'un niveau de quantification (Q5 → Q4) avant d'acheter du nouveau matériel.
- Sous 10 tok/s → semble cassé. Les mots apparaissent un par un avec des pauses perceptibles. Inutilisable pour le chat interactif.
- 15–25 tok/s → acceptable. Vitesse lisible pour la plupart des utilisateurs. Bon pour les Q&R, résumés et aide au code.
- 30+ tok/s → fluide. Se ressent comme un véritable assistant. Confortable pour toutes les tâches interactives.
- 60+ tok/s → instantané. Plus rapide que la lecture. Idéal pour l'autocomplétion en temps réel et l'itération rapide.
Ce qu'il faut éviter sur PC bas de gamme
- N'exécutez pas de modèles 13B+ — ils dépassent les limites RAM. Un modèle 13B en Q4 nécessite 8–10 Go VRAM, au-delà de la capacité pratique d'un PC bas de gamme. Même avec Q2 agressif, les modèles 13B nécessitent 5–6 Go, laissant une marge insuffisante pour l'OS et la planification GPU. Restez sur 7B et moins.
- Évitez la quantification Q8 — plus lente pour un gain de qualité minimal. Q8 utilise presque 2× le VRAM de Q4 (8 Go vs 5,5 Go pour Mistral Small) et n'offre que ~2 % d'amélioration qualité. Pour les systèmes 4 Go, Q8 est impraticable ; pour 8 Go, Q4 reste optimal. Q3 est le seul compromis à envisager quand Q4 provoque un OOM.
- N'attendez pas une autocomplétion en temps réel. À 3 tok/sec sur CPU, générer 50 tokens prend 16 secondes. L'autocomplétion interactive nécessite ≥20 tok/sec. Les LLMs locaux sur CPU bas de gamme conviennent au chat par lots, aux brouillons et à la révision — pas à l'autocomplétion en direct ni au code au fil de la frappe.
- N'utilisez pas l'inférence CPU seul pour des chatbots en production. Acceptable pour les outils internes, les prototypes et le travail par lots hors ligne. Les API cloud (latence 15–20 ms) surpassent les CPU bas de gamme (latence 300+ ms) pour les services orientés utilisateurs. Utilisez l'inférence locale pour les scénarios critiques en confidentialité ou hors ligne, pas pour les scénarios critiques en vitesse.
Erreurs courantes
- Erreur : Choisir TinyLlama pour la vitesse sur CPU. Problème : TinyLlama appartient au niveau 4 Go VRAM, pas au CPU — Phi-4-mini 3.8B est plus rapide et bien meilleur sur du matériel CPU seul. Solution : faites tourner Phi-4-mini 3.8B sur CPU ; réservez TinyLlama Q5 pour 4 Go VRAM.
- Erreur : Ne pas activer les flags d'accélération CPU. Problème : L'absence d'AVX/NEON offre 20 % de gain de vitesse sans coût. Solution : Définissez `LLAMACPP_AVX512=1` ou `LLAMACPP_NEON=1` avant de lancer Ollama.
- Erreur : Forcer Q2 pour faire tenir un 7B dans 4 Go. Problème : La quantification Q2 provoque souvent des crashs OOM à cause du surcoût du cache KV pendant l'inférence. Solution : Utilisez un modèle 3B en Q4 à la place.
- Erreur : Supposer que le matériel plus récent signifie toujours une inférence plus rapide. Problème : Le Ryzen desktop n'est pas plus rapide par token que l'ARM mobile, faute d'optimisation mémoire. Solution : Benchmarkez votre matériel réel.
- Erreur : Utiliser le mauvais slug Ollama pour votre modèle. Problème : `ollama run phi` charge Phi-2, pas Phi-4-mini. Solution : Utilisez `ollama run phi4-mini` pour le dernier modèle Phi. Vérifiez toujours ollama.com/library pour les tags de modèle exacts.
LLMs locaux sur PC bas de gamme : contexte régional
UE / RGPD : Local sur matériel d'entrée de gamme : aucune donnée d'inférence ne quitte l'appareil — pour beaucoup de PME et d'indépendants, une méthode techniquement simple pour éviter les risques de transfert de l'art. 44 RGPD. Le règlement AI de l'UE (applicable depuis février 2025) n'impose pas d'obligations de documentation pour l'inférence personnelle. La CNIL recommande l'IA locale pour le traitement de données professionnelles sensibles (financières, médicales, juridiques) lorsque la confidentialité est prioritaire. La conformité globale en matière de protection des données dépend cependant de l'ensemble de votre fonctionnement, et pas seulement de l'architecture d'inférence.
Japon : Les directives de gouvernance IA du METI encouragent la minimisation des données. L'inférence CPU sur matériel bas de gamme satisfait les exigences les plus strictes de souveraineté des données — pas d'appels API, pas de journalisation, pas d'accès tiers. Pour les utilisateurs japonais exécutant Qwen3 sur CPU pour des tâches en japonais, un débit de 1–3 tok/sec est acceptable pour les résumés de documents non urgents.
Chine : L'inférence locale sur matériel grand public est courante pour les déploiements Qwen3 et DeepSeek-R1, où l'accès aux API cloud de modèles non chinois est restreint. Qwen3 1.7B et 4B fonctionnent sur matériel CPU seul, offrant une alternative fonctionnelle aux API cloud pour les utilisateurs avec un matériel limité.
Questions fréquentes sur l'exécution de LLMs locaux sur PC bas de gamme
Qu'est-ce qui qualifie un PC comme bas de gamme pour les LLMs locaux ?
Un PC bas de gamme pour les LLMs locaux est toute machine CPU seul (sans GPU dédié) avec 4–16 Go de RAM système. Cela inclut la plupart des portables avec graphiques intégrés Intel Iris ou AMD Radeon, les vieux PC de bureau sans GPU dédié, et les mini PC comme l'Intel N100. La contrainte clé est la RAM système pour les poids du modèle, pas la fréquence du CPU.
Puis-je faire tourner un modèle de classe 7B sans aucun GPU ?
Oui — Qwen3 8B en Q4_K_M tourne à 8–15 tok/s avec 16 Go de RAM, CPU seul (testé sur Ryzen 7 7700X). C'est plus lent que les options plus petites mais offre une qualité nettement meilleure. Avec 8 Go de RAM, préférez plutôt Phi-4-mini (3.8B) — un modèle 8B en Q4_K_M a besoin d'une marge qu'un système 8 Go ne garantit pas toujours de façon fiable.
L'inférence CPU est-elle utilisable pour les chatbots ?
Oui, pour un usage interactif si vous choisissez la bonne taille de modèle. Phi-4-mini à 15–25 tok/s (8 Go de RAM) et Qwen3 1.7B à 25–40 tok/s (4 Go de RAM) sont tous deux assez rapides pour le chat en temps réel. Un modèle de classe 7B sur CPU (8–15 tok/s) convient mieux aux tâches par lots — rédaction, résumés, révision hors ligne — qu'à la conversation en direct.
Dois-je utiliser Phi-4-mini ou Qwen3 1.7B sur du matériel CPU seul ?
Utilisez Phi-4-mini (3.8B) si vous avez 8 Go de RAM — il gère le code et le raisonnement à 15–25 tok/s. Utilisez Qwen3 1.7B si vous n'avez que 4 Go de RAM ou voulez la réponse la plus rapide possible (25–40 tok/s) au prix d'un peu de qualité sur les tâches complexes.
Comment vérifier si j'ai un GPU quelconque ?
Exécutez `nvidia-smi` dans le terminal pour les GPU NVIDIA dédiés. Si la réponse est « command not found », vérifiez `lspci` (Linux) ou le Gestionnaire de périphériques (Windows) pour une iGPU Intel Iris Xe ou AMD Radeon — celles-ci peuvent décharger certaines couches même sans support CUDA.
Comment la quantification affecte-t-elle la vitesse d'inférence ?
La quantification réduit principalement les besoins en bande passante mémoire, pas le calcul. Q2 (2 bits) est environ 30 % plus rapide que Q4 (4 bits) car le modèle charge moins d'octets par passe forward. Cependant, Q2 entraîne une pénalité qualité de ~10 %. Règle pratique : utilisez Q4_K_M par défaut pour chaque niveau de ce guide, ne descendez à Q3 que si Q4_K_M ne tient pas dans la RAM disponible.
Puis-je quantifier en dessous de Q2 ?
Techniquement oui (Q1), mais la qualité se dégrade catastrophiquement — jusqu'à 30 % de perte de précision. Non recommandé pour aucun cas d'usage pratique, y compris le niveau 4 Go de RAM de ce guide.
L'inférence hybride CPU + iGPU est-elle supportée ?
Oui, via l'offloading de couches. Sur un système 8 Go de RAM avec iGPU Intel Iris Xe, Qwen3 4B atteint 12–20 tok/s avec offload partiel par rapport au CPU seul. Définissez `OLLAMA_NUM_GPU=1` et Ollama déchargera automatiquement les couches qui tiennent.
Quel est le LLM local le plus rapide pour un PC bas de gamme ?
Qwen3 1.7B en Q4_K_M est le modèle le plus rapide de ce guide — 25–40 tok/s sur un i5/Ryzen 5 récent avec 4 Go de RAM et sans GPU. Pour une meilleure qualité à une vitesse similaire, Phi-4-mini (3.8B) tourne à 15–25 tok/s avec 8 Go de RAM et gère le code et le raisonnement nettement mieux.
Puis-je faire tourner un LLM local avec 4 Go de RAM ?
Oui — Qwen3 1.7B en Q4_K_M est le choix recommandé pour 4 Go de RAM, CPU seul, atteignant 25–40 tok/s sur un i5/Ryzen 5 récent. C'est le modèle le plus rapide de ce guide et il tient avec une marge pour l'OS.
Un GPU est-il nécessaire pour la vitesse ?
Non — tous les modèles de ce guide tournent en CPU seul. Une iGPU Intel Iris ajoute un gain de vitesse notable (Qwen3 4B : 12–20 tok/s avec offload partiel vs. CPU seul) mais reste optionnelle. Un GPU dédié comme une RTX 4060 8 Go d'occasion est 5–10× plus rapide que n'importe quelle configuration CPU, mais c'est une voie de mise à niveau séparée, pas un prérequis.
Sources
- Fiche modèle Phi-4 Mini — Microsoft Research. 68 % MMLU, 70 % HumanEval. Sorti en 2025.
- Fiche modèle Gemma 3 — Google DeepMind. Gemma 3 2B avec fenêtre de contexte 128K. Sorti en 2025.
- Llama 4 Scout 8B — Meta. Fenêtre de contexte 10M, sorti en mars 2026.
- Dépôt TinyLlama 1.1B — Stability AI. Entraînement terminé en 2024. Modèle stable, sans mise à jour. Toujours recommandé pour le niveau 4 Go VRAM.
- Guide d'optimisation CPU llama.cpp — Flags d'accélération CPU incluant AVX-512, NEON et configuration des threads.
