重要なポイント
- 標準ベンチマーク(MMLU、HumanEval)は創作文章の品質を測定しません。自分のサンプルプロンプトで直接評価してください。
- 全体で最高の散文: Llama 3.3 70B -- ローカル実行可能スケールで最も自然な英語ナレーティブスタイル。
- 16GB RAM向けの最高選択肢: Mistral Small 3.1 24B -- 強い創作出力、長編ナレーティングで7Bモデルより明らかに優れています。
- 8GB RAM向けの最高選択肢: Llama 3.3 8B -- 英語フィクションタスクでQwen3 7Bより優れた創作指示遵守。
- コミュニティファインチューン(Fimbulvetr-11B、Midnight-Rose-70B)は創作フィクション用に特別に訓練されており、長編ナレーティブタスクでベースモデルより優れています。
ローカルLLMの創作文章品質をどう評価するか
客観的ベンチマークは知識と推論を測定しますが、創作品質は測定しません。 創作文章用のモデルを評価するには、使用予定のプロンプトで直接テストしてください。
注意点: 標準ベンチマークではスコアが高くても、実際の創作文章の品質とは無関係な場合があります。必ず実際のテストを行ってください。
- 散文継続テスト: モデルにシーンの最初の2段落を与えて、500語の継続を要求します。一貫したトーン、キャラクター音声、ナレーティブロジックを保持していますか?
- スタイル指示テスト: モデルに「レイモンド・カーヴァーのスタイルで」または「スリラー小説のペースで」段落を書くよう要求します。明確にスタイルを変更していますか?
- 長編一貫性テスト: 特定のツイストエンディングで1000語の短編を要求します。モデルは自然にセットアップを配置し、報酬を提供していますか?
- 会話テスト: 異なるスピーチパターンを持つ2つのキャラクターを使用してシーンを書きます。各キャラクターは異なって聞こえますか?

#1 Meta Llama 3.3 70B - ローカルで最高の散文品質
Llama 3.3 70Bはローカル実行可能な任意のモデルの中で最も自然で多様な英語散文を生成します。多様な英語テキストコーパスのトレーニングにより、最広範な文体レンジが得られます。
実用的なコツ: 40GBのメモリが必要ですが、M2 Ultraマシンを使用すれば、1秒間に20-35トークンの速度を達成できます。これにより、実時間での創作セッションに最適です。
| Spec | Value |
|---|---|
| 最適な用途 | 長編フィクション、豊かな散文 |
| RAM必要(Q4_K_M) | ~40 GB |
| 散文スタイル範囲 | ローカルモデル中最広 |
| 長編一貫性 | 強力(1K~3K語シーン) |
| Ollama コマンド | ollama run llama3.3:70b |

#2 Mistral Small 3.1 24B - 16GB RAM向け最高の創作文章
Mistral Small 3 .1 24Bは、7Bモデルより明らかに優れた創作文章品質を提供しながら、14GB RAMに収まります。詳細なスタイル仕様を処理するのに十分な精度があります。
実用的なコツ: ワークステーションクラスのハードウェアなしで本物の長編ナレーティング機能を望むユーザーにとって、これが最良の選択肢です。
#3 Llama 3.3 8B - 8GB RAM向け最高の創作文章
8GB RAMレベルでは、Llama 3 .1 8BはQwen3 7BおよびMistral Smallを英語創作文章で上回ります。Qwen3はコーディングと構造化タスクで強力ですが、英語散文生成はナレーティブ目的で流動性が低くなります。
注意点: 500語以下の短編に適しています。1000語を超えるストーリーでは品質が低下する傾向があります。これは8Bスケールモデルの基本的な制限です。
#4 フィクション・ロールプレイ用コミュニティファインチューン
ローカルLLMコミュニティは、フィクションコーパスでトレーニングされた専門のファインチューンを保持しており、長編ナレーティブタスクでベースモデルを上回ります。 これらはHugging Faceで利用でき、LM StudioまたはOllama(カスタムModelfilesを使用)で読み込むことができます。
実践Tips: Hugging Faceから「creative writing GGUF」を検索して、LM Studioのモデルブラウザに読み込むか、カスタムModelfileで`ollama create`経由で読み込みます。
- Fimbulvetr-11B - ファンタジーおよびサイエンスフィクション散文の高品質でファインチューン。ベースLlama 3.3 8Bより鮮やかな感覚の詳細と一貫したキャラクター音声を生成します。
- Midnight-Rose-70B - 創作文章とロールプレイシナリオに焦点を当てたLlama 3.3 70Bファインチューン。ベースモデルより優れた長編ナレーティング一貫性。
- Noromaid / Openhermes 変種 - 会話型ロールプレイに焦点を当てたコミュニティファインチューン。Fimbulvetrより低い散文品質ですが、キャラクター方向への応答性がより高いです。
- GLM-4(Zhipu AI) - 特に中国語のワークフローやロールプレイ用途がある場合に試す価値のある、もう一つのオープンウェイトの選択肢です。Hugging FaceでGGUF形式で入手可能。英語の散文品質については上記モデルと直接比較評価していないため、決定前に自分のプロンプトでFimbulvetrやLlama 3.3 8Bと比較してください。
ローカルLLMの創作文章を改善するプロンプティングコツ
実践的なテクニック:創作出力の質を大幅に向上させるプロンプティング手法です。
- スタイルを具体的に指定: 「Cormac McCarthyのスタイルで書く - スパースな対話、長い説明文、引用符なし」は「文学フィクションを書く」を上回ります。
- モデルに役割を与える: 「あなたはプロの小説家です。このシーンを続けてください、要約せず、表示するだけで。」指示遵守は、モデルが定義されたアイデンティティを持つ場合に改善されます。
- 温度を0.9~1.1に設定: 創作タスクはより高い温度(より多くのランダム性)の恩恵を受けます。デフォルトOllama温度は0.8です。
- システムプロンプトを使用: セッションレベルで永続的なスタイル指示を設定します。「あなたはゴシックホラー小説を書いています。」
- 長いタスクを複数のセクションに分割: 3,000語のチャプターについては、500語のセクションで生成します。
- ローカルとクラウド出力を比較: PromptQuorumを使用して同じ創作プロンプトを送信します。
- これらのモデルをLM Studioで読み込む: LM StudioとOllamaは同じGGUF量子化ファイルを使用するため、上記のランキングはそのまま当てはまります。LM Studio内蔵のモデルブラウザで「Llama 3.3」「Mistral Small 3.1」「Fimbulvetr」を検索して直接読み込んでください。別途「LM Studio専用の最適モデル」というものは存在しません -- 同じモデルファイルを別のインターフェースで読み込むだけです。
詩(ポエトリー)に最適なローカルLLMはどれですか?
詩は散文とは異なる設定が必要です:厳格な形式(韻律、押韻、音節数)は自由な小説より低い温度で機能します。 形式が厳格な詩(ソネット、俳句など)の場合、温度を0.7-0.85に設定してください -- 上記の散文向けに推奨した0.9-1.1の範囲は、韻律や押韻パターンをむしろ崩すことが多いです。自由詩の場合は散文と同じ温度範囲が適用されます。
- 総合的に最良: Llama 3.3 70B -- 豊かなイメージと最も幅広い文学的技法(隠喩、頭韻、句またがり)の語彙を持ちます。
- 定型詩に最適: ベースのMistral Small 3.1 24BまたはLlama 3.3 8B -- どちらも、散文(小説)向けに訓練されたFimbulvetrのようなフィクション特化ファインチューンより、音節数や押韻パターンを確実に守ります。
- プロンプティングの進め方: 形式を明示的に指定してください -- 「秋の雨についての俳句(5-7-5音節)を書いてください」や「喪失についてのシェイクスピア風ソネット(ABAB CDCD EFEF GG、弱強五歩格)を書いてください」など。曖昧なプロンプト(「愛についての詩を書いて」)はモデルに関わらず一般的な自由詩を生成します。
悪いプロンプト vs 良いプロンプト
- ❌「ファンタジーの物語を書いて」→✅「密輸業者が古代の遺物をめぐって竜と交渉する500語のファンタジーシーンを書いてください。感覚的な描写を使い、対話に緊張感を持たせてください。」
- ❌「何か面白いものを書いて」→✅「失敗した強盗の300語のオープニングシーンを書いてください。主人公は任務の途中でパートナーに裏切られたことに気づきます。テンポに合わせて短く力強い文を使ってください。」
- ❌「ミステリーを書いて」→✅「この探偵のシーンを続けてください:[前のテキスト]。探偵は一つの手がかりから容疑者が嘘をついていることに気づきます。説明せず、彼女がどう矛盾を見抜くかを描写してください。」
- ❌「もっと面白くして」→✅「前の段落をノワール風に書き直してください:まばらな対話、皮肉な内的独白、具体的な感覚描写(音、匂い、質感)。」
ローカルLLMによる創作文章:地域別の背景
日本(METIとローカライゼーション): 日本語の創作文章(小説)はひらがな・カタカナ・漢字の混在表記、複雑な句読点、繊細な文字間隔のルールを使います。日本文学でファインチューンされたモデルは、英語最適化モデルよりこれらのパターンをうまく処理します。Ollamaは Shisa-7B-v1やWeblab-10Bなどの日本語モデルに対応しています。経済産業省(METI)のAIガバナンス方針は、企業がローカルLLMを利用する際のデータ主権にも関連します。
アジア太平洋地域: 中国本土はクラウドAIサービスを制限しコンテンツ規制への準拠を求めます。Qwen3やQwen1.5でローカル実行すれば地政学的な制約を回避できます。独自のストーリーIPを管理する出版社やゲーム開発会社に適しています。
欧州(GDPR): GDPRは、処理されるセンシティブな個人データ(キャラクターの背景設定、出版用フィクションコンテンツ)がEU域内にとどまることを求めています。EU拠点のハードウェアでローカルモデルを実行することでコンプライアンスを確保できます。
ローカルLLMの創作文章についてよくある質問
ローカルLLMはClaudeやGPT-5.5などの執筆補助にとって代わることができますか?
短編コンテンツ(500語未満)の場合、よくプロンプトされた13B以上のローカルモデルは、ブラインドテストではクラウドモデルから区別しにくい出力を生成します。長編フィクション(小説、短編小説全体)の場合、Claude Opus 4.8およびGPT-5.5はハードウェアレベルに関わらずナレーティング一貫性をより確実に保ちます。
モデルは私のストーリーの以前の部分を覚えていますか?
現在のコンテキストウィンドウ内のみです。会話履歴がモデルのコンテキスト制限(通常4K~128Kトークン)を超える場合、以前の詳細は忘れられます。長いプロジェクトの場合、各セッションの開始時に定期的にストーリーサマリーを提供してコンテキストを再確立してください。
最も鮮やかな散文を生成するローカルモデルはどれですか?
Q5_K_M量子化のLlama 3.3 70Bが最も一貫して鮮やかな感覚描写と自然な対話の流れを生成します。Mistral Small 3.1 24Bは45GBのRAMを必要とする70Bに対し、14GBのRAMでこの品質の80-85%を達成します。
章をまたいでキャラクターの声に一貫性がない場合、どう対処すればよいですか?
システムプロンプトに詳細なキャラクターシート(名前、背景、話し方の特徴、動機)を記載し、新しい章を始めるたびにそれを再提示してください。これにより500〜2,000語のセクションにわたって一貫性を保てます。
量子化(Q4、Q5、Q8)は創作文章で目に見えて違いが出ますか?
はい、測定可能な差があります。FP16(フル精度)とQ8はほぼ同一の散文を生成します。Q4は明確な品質低下(一般的な描写、感覚描写の欠如)を招きます。小説にはQ5_K_Mを最低ラインとして推奨します。
創作文章の品質と創作*対話*の品質の違いは何ですか?
対話は簡潔な言葉選びと明確なキャラクターごとの声を必要とし、地の文は感覚的な豊かさと物語の流れを必要とします。Llama 3.3 70Bは両方に優れていますが、小型モデルはしばしば平板で一般的な対話を生成します。
自分の文体でローカルLLMをファインチューニングできますか?
できます。.jsonl形式(入力/出力ペア)で500-2,000件の散文サンプルを収集し、24GB GPUでUnslothまたはAxolotlを使って13Bモデルを4-8時間ファインチューニングしてください。
長編小説の全体構成にはどれくらいのコンテキスト(トークン数)が必要ですか?
80,000語の小説の詳細な構成(プロット、キャラクター、章、対立)は通常3,000-6,000トークンです。128Kコンテキストのモデル(Llama 3.2、Phi-4)なら構成全体と過去の章を1セッションで読み込めます。
創作文章に最適化されたローカルLLMを実行するのにGPUは必要ですか?
必須ではありませんが、生成速度が大幅に向上します。CPU(8コア)の13Bモデルは10-15トークン/秒、12GB GPU(RTX 4070 TiやRTX 5070)では80-100トークン/秒です。
SF世界観構築とストーリーテリングに最適なローカルLLMはどれですか?
50ページ以上の構成の一貫性にはLlama 3.3 70B、技術的正確さにはQwen3 14B-32B、豊かな世界観描写にはFimbulvetr-11B、予算重視ならMistral Small 3.1 24Bが世界観の一貫性とリソース使用のバランスを取ります。
創作文章、フィクション、小説執筆に最適なローカルLLMはどれですか?
Llama 3.3 70B(40GB)が最も豊かな散文と最も幅広い文体を提供します。16GB VRAMではMistral Small 3.1 24B(14GB)、8GB予算ではLlama 3.3 8B(最大500語の短編小説)が適しています。Fimbulvetr-11Bなどのコミュニティファインチューンは小規模なリソース予算でも小説特化の学習を追加します。
8GBのVRAMだけで執筆する場合に最も適したローカルLLMはどれですか?
Llama 3.3 8B Q4_K_M(約6GB)が8GB VRAMでの創作文章に最適な選択肢で、最大500語の短編小説を自然な散文で安定して処理します。
詩(ポエトリー)に最適なローカルLLMはどれですか?
自由詩にはLlama 3.3 70Bが最も幅広い文学的技法を提供します。定型詩(ソネット、俳句)にはフィクション特化ファインチューンではなくベースモデルを使い、温度を0.7-0.85に下げてください。
創作文章のためにLM Studioでどのモデルを読み込むべきですか?
RAM量に応じてLlama 3.3 70B、Mistral Small 3.1 24B、Llama 3.3 8Bのいずれかで同じランキングが適用されます。LM StudioとOllamaは同じGGUFファイルを使うため、別途「LM Studio専用モデル」はありません。
創作文章とストーリーテリングに最適なOllamaモデルはどれですか?
最高の散文品質にはollama run llama3.3:70b(40GB RAM)、16GB RAM帯にはollama run mistral-small3.1、8GB RAMにはollama run llama3.2を使ってください。小説特化にはFimbulvetr-11B(カスタムModelfile経由)が基本モデルを上回ります。
GLM-4は創作文章に適した選択肢ですか?
GLM-4(Zhipu AIのオープンウェイトモデル群)は、特に中国語ワークフローやロールプレイ用途で試す価値のある選択肢です。英語の散文品質についてはLlama 3.3やMistral Smallと直接比較評価していないため、主力モデルを切り替える前に自分のプロンプトでテストしてください。
ソース
- ニューラルストーリー生成論文 - ナレーティング一貫性に関する学術研究
- 創作タスク向けMistral Small - モデルドキュメントと創作ベンチマーク
- Llama 3.3 8B クリエイティブベンチマーク - 創作文章タスクの評価
創作文章プロンプティングの一般的な誤り
- コード最適化モデルを創作タスクに使用 - 創作モデルは異なるトレーニングをしています。
- ローカルモデルが複数の小説ナレーティングを生成することを期待 - 短編テキストで優れています。
- 創作出力用の温度とサンプリングパラメータを調整しない。
関連トピック
- 2026年の最高のローカルLLM - ユースケース全体の総合ランキング
- ノートパソコンでローカルLLMを実行する方法 - ライター向けのパフォーマンス最適化
- 初心者向けベストローカルLLMモデル - 創作文章用基礎モデル
- ローカルLLMの制限事項 - モデル制限の理解
