Points clés
- Les benchmarks standard ne mesurent pas la qualité créative -- testez directement avec vos propres prompts.
- Meilleure prose: Llama 3.3 70B -- style narratif anglais le plus naturel à l'échelle locale.
- Meilleur 16 GB RAM: Mistral Small 3.1 24B -- sortie créative forte, nettement supérieur aux modèles 7B.
- Meilleur 8 GB RAM: Llama 3.3 8B -- meilleur suivi d'instructions créatives que Qwen3 7B.
- Les fine-tunes spécialisés surpassent les modèles de base sur les tâches narratives longues.
Comment évaluer la qualité des LLMs locaux
Les benchmarks objectifs mesurent les connaissances, pas la créativité. Testez directement avec vos prompts :
- Test continuité: donnez les deux premiers paragraphes d'une scène, demandez 500 mots. Ton cohérent?
- Test style: "écrivez dans le style de McCarthy" vs "écrivez de la littérature". Adapte-t-il le style?
- Test cohérence long format: demandez une histoire 1000 mots avec fin surprise. Logique narrative solide?
- Test dialogue: deux personnages différents. Voix distinctes ou uniformes?

#1 Llama 3.3 70B -- meilleure prose localement
Llama 3.3 70B produit la prose anglaise la plus naturelle. Entraîné sur corpus textuels divers, range stylistique très large. Cohérence long format (1K-3K mots) supérieure aux modèles 7B/13B.
Contrainte hardware : 40 GB RAM (Q4_K_M). Pour sessions créatives, vitesse génération lente (8-15 tok/sec CPU) acceptable. Apple M2 Ultra/M5 Max : 20-35 tok/sec.
| Spec | Value |
|---|---|
| Meilleur pour | Fiction long format, prose riche |
| RAM (Q4_K_M) | ~40 GB |
| Plage stylistique | Plus large des modèles locaux |
| Cohérence long | Forte (1K-3K mots) |
| Ollama | ollama run llama3.3:70b |

#2 Mistral Small 3.1 24B -- meilleur 16 GB RAM
Mistral Small 3.1 24B qualité créative notable, entre dans 14 GB RAM. Suivi instructions précis, gère spécifications détaillées sans dérives.
Pour narratif long format sans workstation, c'est le choix pratique.
#3 Llama 3.3 8B -- meilleur 8 GB RAM
À 8 GB RAM, Llama 3.3 8B surpasse Qwen3 7B et Mistral Small. Qwen3 plus fort coding, mais prose moins fluide narratif.
Fiable jusqu'à 500 mots. Au-delà 1K mots, cohérence dégrade. Limitation fondamentale 8B pour long format.
#4 Fine-tunes spécialisés fiction/roleplay
Communauté maintient fine-tunes entraînés corpus fiction, surpassent modèles base. Disponibles Hugging Face, chargeable LM Studio/Ollama :
- Fimbulvetr-11B -- fantasy/SF haute qualité. Détails sensoriels, voix personnage cohérente.
- Midnight-Rose-70B -- Llama 3.3 70B fine-tune créatif. Cohérence narrative supérieure.
- Noromaid/Openhermes -- roleplay conversationnel. Qualité prose inférieure, plus réactif.
- GLM-4 (Zhipu AI) -- autre option à poids ouverts à tester, notamment pour un workflow en chinois ou un usage roleplay. Disponible sur Hugging Face en GGUF ; comparez-le à Fimbulvetr et Llama 3.3 8B sur vos propres prompts, non évalué ici face aux modèles ci-dessus pour la prose anglaise.
- Télécharger Hugging Face ("creative writing GGUF"), charger LM Studio ou via `ollama create` Modelfile.
Conseils pour meilleure créativité
- Style concret: "McCarthy -- dialogues épars, longues phrases, sans guillemets" > "fiction littéraire".
- Rôle model: "Vous êtes romancier professionnel." Identité définie améliore instructions.
- Température 0.9-1.1: créatif bénéficie randomness. Ollama défaut 0.8, LM Studio 0.7.
- System prompt: instruction style persistante. "Vous écrivez horreur gothique. Prose sombre atmosphérique."
- Tâches sections: chapitre 3K mots → 6 sections 500 mots. Maintient cohérence fiable.
- Compare local/cloud: PromptQuorum même prompt local + cloud simultané.
- Charger ces modèles dans LM Studio: LM Studio et Ollama utilisent les mêmes fichiers GGUF quantisés -- le classement ci-dessus s'applique sans changement. Cherchez "Llama 3.3", "Mistral Small 3.1" ou "Fimbulvetr" dans le navigateur de modèles de LM Studio. Pas de "meilleur modèle LM Studio" séparé -- même fichier, interface différente.
Meilleur LLM local pour la poésie
La poésie demande un réglage différent de la prose : une forme stricte (mètre, rime, syllabes) bénéficie d'une température plus basse que la fiction libre. Pour la poésie à forme stricte (sonnets, haïkus), réglez la température entre 0,7 et 0,85 -- la plage 0,9-1,1 recommandée pour la prose casse le mètre et la rime plus qu'elle n'aide. Pour le vers libre, la plage de température de la prose s'applique toujours.
- Meilleur global: Llama 3.3 70B pour des images riches et le vocabulaire de figures de style le plus large.
- Meilleur pour formes structurées: Mistral Small 3.1 24B ou Llama 3.3 8B de base -- plus fiables sur le compte de syllabes et les schémas de rime que les fine-tunes fiction comme Fimbulvetr, entraînés sur la prose narrative et non le vers.
- Approche de prompting: indiquez la forme explicitement -- "Écrivez un haïku (5-7-5 syllabes) sur la pluie d'automne" ou "Écrivez un sonnet shakespearien (ABAB CDCD EFEF GG, pentamètre iambique) sur la perte." Un prompt vague ("écrivez un poème sur l'amour") produit du vers libre générique quel que soit le modèle.
Mauvais prompt vs bon prompt
- ❌ "Écrivez une histoire fantasy" → ✅ "Écrivez une scène fantasy de 500 mots où un contrebandier négocie avec un dragon pour des artefacts anciens. Utilisez des détails sensoriels, dialogue tendu."
- ❌ "Écrivez quelque chose d'intéressant" → ✅ "Écrivez une ouverture de 300 mots d'un braquage qui tourne mal. Le protagoniste découvre en pleine mission que son partenaire l'a trahi. Phrases courtes et percutantes pour le rythme."
- ❌ "Écrivez un mystère" → ✅ "Continuez cette scène de détective : [texte précédent]. Le détective comprend, via un détail, que le suspect ment. Montrez -- ne dites pas -- comment elle repère l'incohérence."
- ❌ "Rendez-le plus intéressant" → ✅ "Réécrivez le paragraphe précédent façon noir : dialogue épars, monologue intérieur cynique, détails sensoriels précis (sons, odeurs, textures)."
Écriture créative avec des LLMs locaux : contexte régional
Europe (RGPD et résidence des données): le RGPD exige que les données personnelles sensibles (biographies de personnages, contenus fictionnels destinés à publication) restent dans l'UE lors du traitement. Faire tourner des modèles locaux sur du matériel basé dans l'UE garantit la conformité. LM Studio et Ollama déployés sur des serveurs français, allemands ou autrichiens respectent les accords de sous-traitance de l'Article 28 sans dépendance au cloud. La CNIL recommande l'IA locale pour les données professionnelles sensibles (financières, médicales, juridiques).
Japon (localisation et encodage): l'écriture créative japonaise utilise des scripts mixtes (hiragana, katakana, kanji) et des règles d'espacement subtiles. Les modèles fine-tunés sur la littérature japonaise gèrent mieux ces patterns que les modèles optimisés pour l'anglais. Ollama fonctionne avec des modèles japonais comme Shisa-7B-v1 et Weblab-10B.
Chine (politique de contenu et accès aux modèles): la Chine continentale restreint les services d'IA cloud. Le fonctionnement local avec Qwen3 ou Qwen1.5 évite ces restrictions géopolitiques et convient aux éditeurs, studios de jeux et entreprises gérant une propriété intellectuelle narrative.
Questions fréquentes
Remplace local LLM Claude/GPT-5.5 fiction?
Court format (<500 mots) : 13B+ local indistinguible blind test. Long format (romans) : Claude Opus 4.8 et GPT-5.5 cohérence plus fiable. 70B local réduit l'écart.
Modèle se souvient parties antérieures?
Contexte actuel uniquement. Au-delà limit (4K-128K tokens), détails oubliés. Longs projets : résumé début session.
Quel modèle local produit la prose la plus vivante?
Llama 3.3 70B en Q5_K_M produit les détails sensoriels les plus vivants. Mistral Small 3.1 24B atteint 80-85% de cette qualité pour 14 GB RAM contre 45 GB.
Comment gérer les incohérences de voix de personnage entre les chapitres?
Fournissez une fiche de personnage détaillée (nom, historique, façon de parler, motivations) dans le prompt système, et réintroduisez-la au début de chaque nouveau chapitre. Cela maintient la cohérence sur des sections de 500 à 2000 mots.
La quantification (Q4, Q5, Q8) est-elle perceptible en écriture créative?
Oui, mesurable. FP16 et Q8 quasi identiques. Q4 provoque une perte de qualité nette (descriptions génériques). Pour la fiction, Q5_K_M minimum.
Puis-je fine-tuner un LLM local sur mon propre style d'écriture?
Oui. Rassemblez 500-2000 exemples au format .jsonl, utilisez Unsloth ou Axolotl sur une GPU 24 GB pour fine-tuner un modèle 13B en 4-8 heures.
Quelle est la différence entre la qualité de l'écriture créative et celle du *dialogue* créatif?
Le dialogue exige une économie de mots et des voix de personnages distinctes ; la prose exige une richesse sensorielle et un flux narratif. Llama 3.3 70B excelle dans les deux ; les modèles plus petits produisent souvent un dialogue plat et générique.
De combien de contexte ai-je besoin pour un plan de roman complet?
Un plan détaillé de roman de 80 000 mots représente typiquement 3000-6000 tokens. Un modèle à contexte 128K (Llama 3.2, Phi-4) permet de charger le plan complet en une session.
Ai-je besoin d'une GPU pour un LLM local optimisé pour l'écriture créative?
Non, mais cela accélère fortement la génération : 10-15 tokens/sec sur CPU contre 80-100 tokens/sec sur GPU 12 GB pour un modèle 13B.
Quel LLM local est le meilleur pour le world-building de science-fiction et le storytelling?
Llama 3.3 70B pour la cohérence sur 50+ pages de plan. Qwen3 14B-32B pour la précision technique. Fimbulvetr-11B pour des détails de monde riches. Mistral Small 3.1 24B pour un budget maîtrisé.
Quel est le meilleur LLM local pour l'écriture créative, la fiction et l'écriture de romans?
Llama 3.3 70B (40 GB) pour la prose la plus riche. Mistral Small 3.1 24B (14 GB) pour 16 GB VRAM. Llama 3.3 8B pour un budget 8 GB. Fimbulvetr-11B pour un entraînement fiction spécialisé.
Quels LLMs locaux fonctionnent le mieux pour écrire avec seulement 8 GB de VRAM?
Llama 3.3 8B Q4_K_M (~6 GB) est le meilleur choix pour l'écriture créative à 8 GB VRAM, fiable jusqu'à 500 mots.
Quel est le meilleur LLM local pour la poésie?
Pour le vers libre, Llama 3.3 70B offre la plus large gamme de figures de style. Pour une forme stricte (sonnets, haïkus), utilisez un modèle de base plutôt qu'un fine-tune fiction, et baissez la température à 0,7-0,85.
Quel modèle charger dans LM Studio pour l'écriture créative?
Le même classement s'applique : Llama 3.3 70B, Mistral Small 3.1 24B ou Llama 3.3 8B selon votre RAM. LM Studio et Ollama utilisent les mêmes fichiers GGUF -- pas de "modèle LM Studio" séparé.
Quel modèle Ollama est le meilleur pour l'écriture créative et le storytelling?
ollama run llama3.3:70b pour la meilleure prose, ollama run mistral-small3.1 pour 16 GB RAM, ollama run llama3.2 pour 8 GB RAM. Fimbulvetr-11B via Modelfile pour la fiction spécialisée.
GLM-4 est-il une bonne option pour l'écriture créative?
GLM-4 (Zhipu AI) est une autre option à poids ouverts à tester, notamment pour un workflow en chinois ou du roleplay -- non comparé ici à Llama 3.3 ou Mistral Small sur la prose anglaise.
Sources
- Papiers génération story IA -- Recherche cohérence narrative
- Mistral documentation -- Benchmarks créatifs
- Llama 3.3 benchmark -- Évaluation écriture créative
Erreurs courantes
- Modèles optimisés code ≠ créativité -- entraînement différent.
- Attendre narratives multi-romans -- excèlle textes courts.
- Oublier température/sampling pour créativité.
