Skip to main content
PromptQuorum
主页/本地LLM/2026年最佳创意写作本地LLM:小说、诗歌和长篇内容排名
Best Models

2026年最佳创意写作本地LLM:小说、诗歌和长篇内容排名

·8分钟阅读·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

2026年最佳创意写作本地LLM是Meta Llama 3.3 70B(最佳散文质量)、Mistral Small 3.1 24B(16GB RAM以下最佳质量)以及Fimbulvetr和Midnight-Rose等社区微调模型(专门针对小说和角色扮演)。创意写作性能并未被标准基准测试准确衡量----需要评估叙事连贯性、文体多样性以及对开放式提示的指令遵循。

2026年最佳创意写作本地LLM:小说、诗歌和长篇内容排名

关键要点

  • 标准基准(MMLU、HumanEval)无法测量创意写作质量----直接用自己的示例提示测试模型。
  • 整体最佳散文:Llama 3.3 70B----本地可运行规模中最自然的英文叙事风格。
  • 16GB RAM最佳选择:Mistral Small 3.1 24B----强大的创意输出,长篇叙事中明显优于7B模型。
  • 8GB RAM最佳选择:Llama 3.3 8B----英文小说任务中创意指令遵循优于Qwen3 7B。
  • 社区微调模型(Fimbulvetr-11B、Midnight-Rose-70B)专门针对创意小说训练,在长篇叙事任务中优于基础模型。

如何评估本地LLM的创意写作质量

客观基准测试衡量的是知识和推理,而非创意质量。 要评估一个模型的创意写作能力,需要直接用你计划使用的提示进行测试。

实用建议:不要依赖基准分数。您需要自己运行这四个测试,才能找到适合您创意写作风格的模型。

  • 散文连贯性测试:给模型一个场景的前两段,要求继续写500字。它是否保持了一致的语调、人物声音和叙事逻辑?
  • 风格指令测试:要求模型"用雷蒙德·卡弗的风格"或"用惊悚小说的节奏"写一段。它是否明显改变了风格,还是产生了泛化输出?
  • 长篇连贯性测试:要求写一篇1000字的短篇故事,有特定的反转结局。模型是否自然地铺垫设置并交付转折?
  • 对话测试:写一个包含两个有不同讲话模式角色的场景。每个角色听起来是否不同,还是对话显得单调?
创意写作本地LLM对比: Llama 3.3 70B(40GB,最佳散文)、Mistral 24B(14GB,16GB级)、Llama 3.3 8B(6GB,入门级)。
创意写作本地LLM对比: Llama 3.3 70B(40GB,最佳散文)、Mistral 24B(14GB,16GB级)、Llama 3.3 8B(6GB,入门级)。

#1 Meta Llama 3.3 70B - 本地最佳散文质量

Llama 3.3 70B生成任何本地可运行模型中最自然、最多样的英文散文。其在多样化英文文本语料库上的训练赋予了它最广泛的文体范围----从极简主义文学小说到类型化惊悚小说的节奏。长篇连贯性(1000-3000字)明显优于任何7B或13B模型。

实用建议:虽然需要40GB内存,但在Apple M2 Ultra或M5 Max上运行时,您可以获得每秒20-35令牌的速度,使实时创意会话成为可能。这为长篇小说创作者提供了最佳权衡。

SpecValue
最适合长篇小说、丰富散文
RAM需求(Q4_K_M)~40 GB
散文风格范围所有本地模型中最广
长篇连贯性强大(1K-3K字场景)
Ollama命令ollama run llama3.3:70b
创意写作质量谱: 8B处理500字故事,24B支持2K字,70B维持1K-3K字场景,风格范围最广。
创意写作质量谱: 8B处理500字故事,24B支持2K字,70B维持1K-3K字场景,风格范围最广。

#2 Mistral Small 3.1 24B - 16GB RAM最佳创意写作

Mistral Small 3 .1 24B提供的创意写作质量明显优于任何7B模型,同时适配14GB内存。其指令遵循足够精确,可以处理详细的风格规范("用第二人称、现在时、短而有力的句子写作")而不会在几段后偏离。

实用建议:对于希望获得真正长篇叙事能力但没有工作站级硬件的用户,这是最佳实际选择。您可以在标准笔记本电脑上运行此模型。

#3 Llama 3.3 8B - 8GB RAM最佳创意写作

在8GB内存级别,Llama 3 .1 8B在英文创意写作中优于Qwen3 7B和Mistral Small。Qwen3在编码和结构化任务中更强,但其英文散文生成对叙事目的来说流畅性较低。

实用建议:Llama 3.3 8B能可靠处理短篇小说(最多500字)。对于超过1000字的故事,质量开始下降。如果您需要长篇小说,请升级到16GB RAM的Mistral Small或40GB的Llama 3.3。

#4 小说和角色扮演社区微调模型

本地LLM社区维护在小说语料库上训练的专门微调模型,在长篇叙事任务中优于基础模型。 这些在Hugging Face上可用,可在LM Studio或Ollama中加载。

实用建议:使用这些微调模型,您可以获得更好的创意输出,同时保持完全本地化。对于特定的创意写作风格(例如幻想小说或网络文学),这些微调提供了优越的性能。

  • Fimbulvetr-11B - 在高质量奇幻和科幻散文上微调。比基础Llama 3.3 8B产生更生动的感觉细节和一致的角色声音。
  • Midnight-Rose-70B - Llama 3.3 70B微调版本,专注于创意写作和角色扮演场景。长篇叙事连贯性优于基础模型。
  • Noromaid / Openhermes变体 - 社区微调模型,专注于对话式角色扮演。散文质量低于Fimbulvetr,但对角色指导响应性更强。
  • GLM-4(智谱AI) - 另一个值得测试的开源权重选项,尤其适合已经使用中文工作流或角色扮演场景的用户。可在Hugging Face上以GGUF格式获取;本文未针对英文散文质量将其与上述模型直接对比,决定前请用自己的提示词与Fimbulvetr和Llama 3.3 8B进行比较。
  • 从Hugging Face下载这些(搜索"creative writing GGUF")并在LM Studio的模型浏览器中加载,或通过自定义Modelfile的`ollama create`加载。

改进本地LLM创意写作的提示技巧

  • 具体指定风格:"用Cormac McCarthy的风格写作----稀疏对话、长描述句子、无引号"优于"写文学小说"。
  • 给模型分配角色:"你是一位专业小说家。继续这个场景,只显示不总结。"当模型有明确身份时,指令遵循改进。
  • 将温度设置为0.9-1.1:创意任务受益于更高温度(更多随机性)。默认Ollama温度为0.8;LM Studio默认为0.7。通过参数滑块增加。
  • 使用系统提示:在会话级别设置持久风格指令。"你在写哥特式恐怖小说。在所有响应中保持深色、大气散文。"
  • 将长任务分解为各部分:对于3000字章节,分500字部分生成。这使模型保持在其可靠连贯性范围内。
  • 比较本地和云输出:使用PromptQuorum同时向本地Ollama模型和云模型发送相同的创意提示。有助于判断本地质量何时足够。
  • 在LM Studio中加载这些模型:LM Studio和Ollama使用相同的GGUF量化文件,因此上述排名同样适用----在LM Studio内置的模型浏览器中搜索"Llama 3.3"、"Mistral Small 3.1"或"Fimbulvetr"并直接加载。并不存在单独的"LM Studio最佳模型",只是同一个模型文件通过不同界面加载。
创意写作LLM温度指南: 0.7默认太单调,0.9-1.05最适合小说,超过1.1输出不连贯。
创意写作LLM温度指南: 0.7默认太单调,0.9-1.05最适合小说,超过1.1输出不连贯。

最适合诗歌创作的本地LLM

诗歌需要与散文不同的设置:严格的形式(韵律、押韵、音节数)在较低温度下表现更好,而非自由流动小说所用的较高温度。 对于形式严格的诗歌(十四行诗、俳句等),将温度设置为0.7-0.85----上文为散文推荐的0.9-1.1范围更容易破坏韵律和押韵结构。对于自由诗,散文的温度范围仍然适用。

  • 总体最佳:Llama 3.3 70B,提供丰富的意象和最广泛的文学修辞手法(隐喻、头韵、跨行)词汇。
  • 最适合结构化形式:基础版Mistral Small 3.1 24B或Llama 3.3 8B----两者在音节数和押韵结构上都比Fimbulvetr等小说特化微调模型更可靠,因为后者是基于叙事散文而非诗歌训练的。
  • 提示方法:明确说明形式----例如"写一首关于秋雨的俳句(5-7-5音节)"或"写一首关于失去的莎士比亚十四行诗(ABAB CDCD EFEF GG,抑扬格五音步)"。模糊的提示("写一首关于爱情的诗")无论模型如何都会生成泛化的自由诗。

不好的提示 vs 好的提示

  • ❌"写一个奇幻故事"→✅"写一个500字的奇幻场景,一名走私者与一条龙就古代文物进行谈判。使用感官细节,让对话充满张力。"
  • ❌"写点有趣的东西"→✅"写一个300字的开场,一场抢劫出了岔子。主人公在任务途中发现同伙背叛了自己。使用简短有力的句子来匹配节奏。"
  • ❌"写一个悬疑故事"→✅"续写这个侦探场景:[前文]。侦探根据一个细节意识到嫌疑人在撒谎。请展示----而非直接说明----她是如何发现矛盾之处的。"
  • ❌"让它更有趣"→✅"将前一段改写为黑色小说风格:稀疏的对话、愤世嫉俗的内心独白、具体的感官细节(声音、气味、质感)。"

本地LLM创意写作:区域背景

中国(数据安全法):中国2021年《数据安全法》要求内容审核合规,本地推理有助于满足这些要求。使用Qwen3或Qwen1.5进行本地部署适合管理专有故事IP的中国出版商、游戏开发者和企业。

亚太地区(数据跨境):亚太地区的数据主权框架日益增多,本地部署可避免跨境数据传输的合规复杂性,适合面向多个亚太市场的企业内容团队。

企业部署:金融、医疗、法律等受监管行业的企业在使用创意写作LLM生成营销或培训内容时,本地部署可确保内容和客户数据不离开企业自有基础设施。

关于本地LLM创意写作的常见问题

本地LLM能否取代Claude或GPT-5.5等写作助手?

对于短篇内容(500字以下),经过良好提示的13B+本地模型生成的输出在盲测中难以与云模型区分。对于长篇小说(小说、完整短篇故事),Claude Opus 4.8和GPT-5.5在任何硬件级别都能更可靠地保持叙事连贯性。70B本地模型显著缩小了这一差距。

模型能否记住我故事的早期部分?

仅在当前上下文窗口内。如果对话历史超过模型的上下文限制(通常4K-128K标记),早期细节会被遗忘。对于长期项目,在每个会话开始时定期提供故事摘要以重新建立上下文。

哪个本地模型能生成最生动的散文?

使用Q5_K_M量化的Llama 3.3 70B最一致地生成生动的感官细节和自然的对话流。Mistral Small 3.1 24B以14GB内存(相对70B的45GB)达到这一质量的80-85%。

如何处理不同章节之间角色声音不一致的问题?

在系统提示中提供详细的角色卡(姓名、背景、说话方式、动机),并在每个新章节开头重新提供该角色卡。这样可以在500-2,000字的段落中保持一致性。

量化(Q4、Q5、Q8)在创意写作中是否明显?

是的,可测量。FP16和Q8生成的散文几乎相同。Q4会造成明显的质量下降:描述泛化、缺少感官细节。对于小说创作,建议至少使用Q5_K_M。

我能否用自己的写作风格微调本地LLM?

可以。收集500-2,000个.jsonl格式(输入/输出对)的散文样本,然后在24GB GPU上使用Unsloth或Axolotl库,在4-8小时内微调一个13B模型。

创意写作质量和创意*对话*质量有什么区别?

对话需要更精炼的用词和鲜明的角色声音;散文需要感官丰富度和叙事流畅性。Llama 3.3 70B在两方面都表现出色,而较小的模型往往产生平淡、泛化的对话。

完整的小说大纲需要多少上下文(token)?

一部80,000字小说的详细大纲(情节、人物、章节、冲突)通常为3,000-6,000个token。128K上下文的模型(Llama 3.2、Phi-4)可以在一次会话中加载整个大纲和之前的章节。

运行针对创意写作优化的本地LLM需要GPU吗?

不是必须的,但GPU能大幅加快生成速度。13B模型在CPU(8核)上为每秒10-15个token,在12GB GPU(RTX 4070 Ti或RTX 5070)上可达每秒80-100个token。

哪个本地LLM最适合科幻世界观构建和故事讲述?

Llama 3.3 70B适合50页以上大纲的一致性,Qwen3 14B-32B适合技术准确性(物理、轨道力学、化学),Fimbulvetr-11B适合丰富的世界描写细节,Mistral Small 3.1 24B在预算有限时平衡世界观一致性与资源使用。

哪个本地LLM最适合创意写作、小说和长篇小说创作?

Llama 3.3 70B(40GB)提供最丰富的散文和最广泛的文体范围。16GB VRAM可选Mistral Small 3.1 24B(14GB),8GB预算可选Llama 3.3 8B(最多500字短篇)。Fimbulvetr-11B等社区微调模型在较小资源预算下增加了小说专项训练。

仅有8GB VRAM时,哪些本地LLM最适合写作?

Llama 3.3 8B Q4_K_M(约6GB)是8GB VRAM下创意写作的最佳选择,能可靠处理最多500字的短篇小说,散文自然流畅。

哪个本地LLM最适合诗歌创作?

对于自由诗,Llama 3.3 70B提供最广泛的文学修辞手法。对于形式严格的诗歌(十四行诗、俳句),应使用基础模型而非小说特化微调模型,并将温度降至0.7-0.85。

创意写作应该在LM Studio中加载哪个模型?

同样的排名适用:根据你的内存级别选择Llama 3.3 70B、Mistral Small 3.1 24B或Llama 3.3 8B。LM Studio和Ollama使用相同的GGUF文件,并不存在单独的"LM Studio模型"。

哪个Ollama模型最适合创意写作和故事讲述?

追求最佳散文质量选择ollama run llama3.3:70b(40GB内存),16GB内存级别选择ollama run mistral-small3.1,8GB内存选择ollama run llama3.2。专注小说和故事创作时,Fimbulvetr-11B(通过自定义Modelfile加载)在持续叙事任务上优于基础模型。

GLM-4是创意写作的好选择吗?

GLM-4(智谱AI的开源权重模型系列)是另一个值得测试的选项,尤其适合中文工作流或角色扮演场景。本文未在英文散文质量上将其与Llama 3.3或Mistral Small直接对比,切换主力模型前请先用自己的样本提示进行测试。

信息来源

  • 神经故事生成论文 - 关于叙事连贯性的学术研究
  • 创意任务的Mistral Small - 模型文档和创意基准
  • Llama 3.3 8B创意基准 - 创意写作任务评估

创意写作提示的常见错误

  • 对创意任务使用代码优化模型----创意模型训练方式不同。
  • 期望本地模型生成多部小说叙事----它们在短篇创意文本中表现出色。
  • 不为创意输出调整温度和采样参数。

相关阅读

关于第三方事实的说明

本文引用了第三方AI模型、基准测试、价格和许可证。AI领域变化迅速。基准分数、许可条款、模型名称和API价格可能在写作时间和您阅读时之间发生变化。在根据本文做出部署或合规决策之前,请在每个提供商的官方来源核实当前数据:Hugging Face模型卡用于许可证和基准测试,提供商网站用于API定价,EUR-Lex用于当前GDPR和EU AI法案文本。本文反映截至2026年5月的公开可用信息。

使用本地LLM、您自己的API密钥或两者运行PromptQuorum — 您来决定使用哪个后端。

下载 PromptQuorum 测试版 →

← 返回本地LLM