Skip to main content
PromptQuorumPromptQuorum
Home/Local LLMs/2026년 창작 글쓰기를 위한 최고의 로컬 LLM: 소설, 시, 장편 콘텐츠
최고의 모델

2026년 창작 글쓰기를 위한 최고의 로컬 LLM: 소설, 시, 장편 콘텐츠

·8분 읽기·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

2026년 4월 기준, 창작 글쓰기를 위한 최고의 로컬 LLM은 Meta Llama 3.3 70B(최고의 산문 품질), Mistral Small 3.1 24B(16 GB RAM 이하에서 최고의 품질), 그리고 Fimbulvetr와 같은 커뮤니티 파인튜닝 모델입니다.

2026년 4월 기준, 창작 글쓰기를 위한 최고의 로컬 LLM은 Meta Llama 3.3 70B(최고의 산문 품질), Mistral Small 3.1 24B(16 GB RAM 이하에서 최고의 품질), 그리고 Fimbulvetr 및 Midnight-Rose와 같은 커뮤니티 파인튜닝 모델(소설 및 롤플레이에 특화)입니다. 창작 글쓰기 성능은 표준 벤치마크로 잘 측정되지 않습니다 -- 이를 평가하려면 서사적 일관성, 문체 범위, 그리고 개방형 프롬프트에 대한 지시 이행 능력을 직접 평가해야 합니다.

2026년 창작 글쓰기를 위한 최고의 로컬 LLM: 소설, 시, 장편 콘텐츠

Key Takeaways

  • 표준 벤치마크(MMLU, HumanEval)는 창작 글쓰기 품질을 측정하지 않습니다 -- 직접 작성한 샘플 프롬프트로 모델을 평가하십시오.
  • 전반적으로 최고의 산문: Llama 3.3 70B -- 로컬에서 실행 가능한 규모 내에서 가장 자연스러운 서사 문체.
  • 16 GB RAM 최적: Mistral Small 3.1 24B -- 강력한 창작 출력, 장편 서사에서 7B 모델보다 현저히 우수.
  • 8 GB RAM 최적: Llama 3.3 8B -- 영어 소설 작업에서 Qwen3 7B보다 창작 지시 이행 능력이 뛰어남.
  • 창작 소설 데이터로 특화 훈련된 커뮤니티 파인튜닝 모델(Fimbulvetr-11B, Midnight-Rose-70B)은 지속적인 서사 작업에서 기본 Llama 모델을 능가합니다.

로컬 LLM의 창작 글쓰기 품질을 어떻게 평가합니까?

2026년 4월 기준, 창작 글쓰기 성능은 표준 벤치마크(MMLU, HumanEval)로 잘 측정되지 않습니다. 창작 글쓰기를 위해 모델을 평가하려면 실제로 사용할 유형의 프롬프트로 직접 테스트해야 합니다:

  • 산문 연속성 테스트: 장면의 첫 두 단락을 모델에게 제공하고 500단어로 이어서 쓰도록 요청하십시오. 일관된 어조, 캐릭터 목소리, 서사적 논리를 유지합니까?
  • 문체 지시 테스트: 모델에게 "레이먼드 카버 스타일로" 또는 "스릴러 소설의 페이스로" 단락을 써달라고 요청하십시오. 문체가 실질적으로 변화합니까, 아니면 일반적인 출력을 생성합니까?
  • 장편 일관성 테스트: 특정 반전 결말이 있는 1,000단어 단편 소설을 요청하십시오. 모델이 자연스럽게 복선을 심고 결말을 전달합니까?
  • 대화 테스트: 서로 다른 말투를 가진 두 캐릭터가 등장하는 장면을 써보십시오. 각 캐릭터의 목소리가 뚜렷합니까, 아니면 대화가 균일하게 느껴집니까?
창작 글쓰기 로컬 LLM 비교: Llama 3.3 70B(40GB, 최고의 산문), Mistral 24B(14GB, 16GB 티어), Llama 3.3 8B(6GB, 입문 티어).
창작 글쓰기 로컬 LLM 비교: Llama 3.3 70B(40GB, 최고의 산문), Mistral 24B(14GB, 16GB 티어), Llama 3.3 8B(6GB, 입문 티어).

#1 Meta Llama 3.3 70B -- 로컬에서 최고의 산문 품질

Llama 3.3 70B는 로컬에서 실행 가능한 모델 중 가장 자연스럽고 다양한 산문을 생성합니다. 다양한 영문 텍스트 코퍼스로 훈련된 덕분에 미니멀리즘 문학 소설부터 장르 스릴러 페이스까지 가장 넓은 문체 범위를 보유하고 있습니다. 장편 일관성(1,000-3,000단어)은 7B 또는 13B 모델보다 현저히 우수합니다.

제약 조건은 하드웨어입니다: Q4_K_M 기준 40 GB RAM. 창작 글쓰기 세션(배치 생성이 아닌)의 경우, CPU에서의 느린 생성 속도(8-15 tok/sec)는 허용 가능합니다. 64+ GB 통합 메모리를 탑재한 Apple M2 Ultra 또는 M5 Max에서는 20-35 tok/sec에 도달합니다.

SpecValue
최적 용도장편 소설, 풍부한 산문
필요 RAM (Q4_K_M)~40 GB
산문 문체 범위로컬 모델 중 가장 넓음
장편 일관성강함 (1K-3K 단어 장면)
Ollama 명령어ollama run llama3.3:70b
로컬 LLM 창작 글쓰기 품질 스펙트럼: 8B는 500단어 이야기, 24B는 최대 2K단어, 70B는 가장 넓은 문체 범위로 1K-3K 단어 장면을 지속합니다.
로컬 LLM 창작 글쓰기 품질 스펙트럼: 8B는 500단어 이야기, 24B는 최대 2K단어, 70B는 가장 넓은 문체 범위로 1K-3K 단어 장면을 지속합니다.

#2 Mistral Small 3.1 24B -- 16 GB RAM에서 최고의 창작 글쓰기

Mistral Small 3.1 24B는 14 GB RAM에 맞으면서도 7B 모델보다 현저히 우수한 창작 글쓰기 품질을 제공합니다. 지시 이행 능력이 충분히 정확하여 "2인칭, 현재 시제, 짧고 강렬한 문장으로 쓰십시오"와 같은 세부적인 문체 지정을 여러 단락이 지나도 유지할 수 있습니다.

워크스테이션급 기계 없이 진정한 장편 서사 능력을 원하는 사용자에게 Mistral Small 3.1은 실용적인 선택입니다.

SpecValue
최적 용도장편 서사, 문체 지시
필요 RAM (Q4_K_M)~14 GB
산문 문체 범위강함 -- 7B 클래스보다 현저히 우수
장편 일관성양호 (500-1,500 단어 장면)
Ollama 명령어ollama run mistral-small3.1

#3 Llama 3.3 8B -- 8 GB RAM에서 최고의 창작 글쓰기

8 GB RAM 티어에서 Llama 3.3 8B는 영어 창작 글쓰기에서 Qwen3 7B와 Mistral Small을 능가합니다. Qwen3는 코딩 및 구조화된 작업에서 더 강하지만, 서사 목적의 영어 산문 생성에서는 유창성이 떨어집니다.

Llama 3.3 8B는 단편 소설(최대 500단어)을 안정적으로 처리합니다. 1,000단어 이상의 이야기에서는 품질 일관성이 저하됩니다 -- 모델이 설정된 서사적 세부 사항에서 벗어나는 경향이 있습니다. 이는 장편 창작 작업에서 8B 규모 모델의 근본적인 한계입니다.

#4 소설 및 롤플레이를 위한 커뮤니티 파인튜닝 모델

로컬 LLM 커뮤니티는 소설 코퍼스로 훈련된 특화 파인튜닝 모델을 유지 관리하며, 이 모델들은 지속적인 서사 작업에서 기본 모델을 능가합니다. Hugging Face에서 구할 수 있으며 LM Studio 또는 Ollama(커스텀 Modelfile 사용)에서 로드할 수 있습니다:

  • Fimbulvetr-11B -- 고품질 판타지 및 SF 산문으로 파인튜닝. 기본 Llama 3.3 8B보다 더 생생한 감각적 세부 묘사와 일관된 캐릭터 목소리를 생성합니다.
  • Midnight-Rose-70B -- 창작 글쓰기 및 롤플레이 시나리오에 집중한 Llama 3.3 70B 파인튜닝 모델. 기본 모델보다 더 나은 장편 서사 일관성을 보입니다.
  • Noromaid / Openhermes 변형 -- 대화형 롤플레이에 집중한 커뮤니티 파인튜닝 모델. Fimbulvetr보다 산문 품질은 낮지만 캐릭터 지시에 더 잘 반응합니다.
  • GLM-4 (Zhipu AI) -- 특히 이미 중국어 워크플로우를 사용하고 있거나 롤플레이 중심 사용 사례가 있다면 창작 글쓰기용으로 테스트해볼 만한 또 다른 오픈 웨이트 옵션입니다. Hugging Face에서 GGUF 형식으로 제공됩니다. 위 모델들과 영어 산문 품질을 직접 비교 평가하지는 않았으므로, 결정하기 전에 직접 프롬프트로 Fimbulvetr 및 Llama 3.3 8B와 비교해 보십시오.
  • Hugging Face에서 이 모델들을 다운로드하고("creative writing GGUF" 검색) LM Studio의 모델 브라우저에서 로드하거나 커스텀 Modelfile과 함께 `ollama create`를 사용하여 로드하십시오.

로컬 LLM 창작 글쓰기를 향상시키는 프롬프팅 팁

  • 문체를 구체적으로 지정하십시오: "코맥 매카시 스타일로 쓰십시오 -- 간결한 대화, 긴 묘사 문장, 따옴표 없음"이 "문학 소설을 쓰십시오"보다 훨씬 효과적입니다.
  • 모델에게 역할을 부여하십시오: "당신은 전문 소설가입니다. 요약하지 말고 보여주기 방식으로만 이 장면을 이어가십시오." 모델이 정의된 정체성을 가질 때 지시 이행이 향상됩니다.
  • 온도를 0.9-1.1로 설정하십시오: 창작 작업은 높은 온도(더 많은 무작위성)에서 유리합니다. 기본 Ollama 온도는 0.8이고 LM Studio 기본값은 0.7입니다. 파라미터 슬라이더를 통해 조정하십시오.
  • 시스템 프롬프트를 사용하십시오: 세션 수준에서 지속적인 문체 지시를 설정하십시오. "당신은 고딕 공포 소설을 쓰고 있습니다. 모든 응답에서 어둡고 분위기 있는 산문을 유지하십시오."
  • 긴 작업을 섹션으로 나누십시오: 3,000단어 챕터의 경우 500단어 섹션으로 나누어 생성하십시오. 이렇게 하면 모델의 신뢰할 수 있는 일관성 범위 내에서 작업할 수 있습니다.
  • 로컬 출력과 클라우드 출력을 비교하십시오: PromptQuorum을 사용하여 동일한 창작 프롬프트를 로컬 Ollama 모델과 클라우드 모델에 동시에 전송하십시오 -- 로컬 품질이 충분한지 보정하는 데 유용합니다.
  • 이 모델들을 LM Studio에서 로드하기: LM Studio와 Ollama는 동일한 GGUF 양자화 파일을 실행하므로, 위의 순위가 그대로 적용됩니다 -- LM Studio 내장 모델 브라우저에서 "Llama 3.3", "Mistral Small 3.1", "Fimbulvetr"를 검색해 바로 로드하십시오. 별도의 "최고의 LM Studio 모델"이라는 것은 없으며, 다른 인터페이스로 로드되는 동일한 모델 파일일 뿐입니다.
창작 글쓰기를 위한 LLM 온도 가이드: 기본 0.7은 너무 평탄하고, 0.9-1.05가 소설에 최적이며, 1.1 초과 시 비일관적인 출력이 발생합니다.
창작 글쓰기를 위한 LLM 온도 가이드: 기본 0.7은 너무 평탄하고, 0.9-1.05가 소설에 최적이며, 1.1 초과 시 비일관적인 출력이 발생합니다.

시(poetry)에 가장 적합한 로컬 LLM은 무엇입니까?

시는 산문과 다른 설정이 필요합니다: 엄격한 형식(운율, 라임, 음절 수)은 자유롭게 흐르는 소설보다 낮은 온도에서 더 잘 작동합니다. 형식이 엄격한 시(소네트, 하이쿠, 빌라넬)의 경우 온도를 0.7-0.85로 설정하십시오 -- 위에서 산문에 권장한 0.9-1.1 범위는 운율과 라임 구조를 오히려 깨뜨리는 경우가 더 많습니다. 자유시의 경우 산문 온도 범위가 여전히 적용됩니다.

  • 전반적으로 최고: Llama 3.3 70B -- 풍부한 이미지와 가장 폭넓은 문학적 기법(은유, 두운, 행간걸침) 어휘를 제공합니다.
  • 형식이 있는 시에 최적: 기본 Mistral Small 3.1 24B 또는 Llama 3.3 8B -- 두 모델 모두 소설 특화 파인튜닝 모델(Fimbulvetr 등, 운문이 아닌 서사 산문으로 훈련됨)보다 음절 수와 라임 구조를 더 안정적으로 지킵니다.
  • 프롬프팅 접근법: 형식을 명시적으로 지정하십시오 -- "가을비에 대한 하이쿠(5-7-5 음절)를 써주세요" 또는 "상실에 대한 셰익스피어식 소네트(ABAB CDCD EFEF GG, 약강 오보격)를 써주세요." 모호한 프롬프트("사랑에 대한 시를 써주세요")는 모델과 상관없이 일반적인 자유시를 생성합니다.

나쁜 프롬프트 vs 좋은 프롬프트

  • ❌ "판타지 이야기를 써주세요" → ✅ "밀수업자가 고대 유물을 두고 용과 협상하는 500단어 판타지 장면을 쓰십시오. 감각적 세부 묘사를 사용하고 대화를 긴장감 있게 만드십시오."
  • ❌ "흥미로운 것을 써주세요" → ✅ "일이 틀어진 절도 장면의 300단어 오프닝을 쓰십시오. 주인공이 임무 도중 파트너가 자신을 배신했다는 것을 알게 됩니다. 빠른 페이스에 맞게 짧고 강렬한 문장을 사용하십시오."
  • ❌ "미스터리를 써주세요" → ✅ "이 탐정 장면을 이어서 쓰십시오: [이전 텍스트]. 탐정이 한 가지 세부 사항을 통해 용의자가 거짓말하고 있다는 것을 깨닫습니다. 그녀가 어떻게 불일치를 포착하는지 말하지 말고 보여주십시오."
  • ❌ "더 흥미롭게 만들어 주세요" → ✅ "이전 단락을 누아르 소설처럼 다시 쓰십시오: 간결한 대화, 냉소적인 내면 독백, 구체적인 감각적 세부 묘사(소리, 냄새, 질감)."

로컬 LLM을 활용한 창작 글쓰기: 지역별 맥락

유럽 (GDPR 및 데이터 거주): GDPR은 처리 시 민감한 개인 데이터(캐릭터 배경 이야기, 출판용 픽션 콘텐츠)가 EU 내에 유지될 것을 요구합니다. EU 기반 하드웨어에서 로컬 모델을 실행하면 규정 준수가 보장됩니다. 독일, 프랑스 또는 오스트리아 서버에 배포된 LM Studio 및 Ollama는 클라우드 의존 없이 제28조 처리자 계약을 충족합니다.

일본 (현지화 및 문자 인코딩): 일본어 창작 글쓰기는 혼합 문자(히라가나, 가타카나, 한자), 복잡한 구두점, 미묘한 띄어쓰기 규칙을 사용합니다. 일본 문학으로 파인튜닝된 모델은 영어 최적화 모델보다 이러한 패턴을 더 잘 처리합니다. LM Studio는 UTF-8 및 Unicode를 지원하며, Ollama는 Shisa-7B-v1 및 Weblab-10B와 같은 일본어 모델과 작동합니다.

중국 (콘텐츠 정책 및 모델 접근): 중국 본토는 클라우드 AI 서비스를 제한하고 콘텐츠 검열 규정 준수를 요구합니다. Qwen3 또는 Qwen1.5로 로컬에서 실행하면 지정학적 제한을 피할 수 있습니다. 로컬 배포는 독점 스토리 IP를 관리하는 중국 출판사, 게임 개발자 및 기업에 적합합니다.

로컬 LLM이 소설 창작에서 Claude나 GPT-5.5 같은 작문 보조 도구를 대체할 수 있습니까?

단편 콘텐츠(500단어 이하)의 경우, 잘 프롬프팅된 13B+ 로컬 모델은 블라인드 테스트에서 클라우드 모델과 구별하기 어려운 출력을 생성합니다. 장편 소설(소설, 완전한 단편 소설)의 경우, Claude Opus 4.8과 GPT-5.5는 어떤 하드웨어 티어에서도 서사적 일관성을 더 안정적으로 유지합니다. 70B 로컬 모델은 이 격차를 상당히 좁힙니다.

모델이 내 이야기의 이전 부분을 기억합니까?

현재 컨텍스트 창 내에서만 기억합니다. 대화 기록이 모델의 컨텍스트 한도(일반적으로 4K-128K 토큰)를 초과하면 이전 세부 사항은 잊혀집니다. 장기 프로젝트의 경우, 각 세션 시작 시 정기적으로 이야기 요약을 제공하여 컨텍스트를 재설정하십시오.

가장 생생한 산문을 생성하는 로컬 모델은 무엇입니까?

Q5_K_M 양자화로 실행한 Llama 3.3 70B가 가장 일관되게 생생한 감각적 세부 묘사와 자연스러운 대화 흐름을 생성합니다. Mistral Small 3.1 24B는 70B의 45 GB RAM 대비 14 GB RAM으로 이 품질의 80-85%를 달성합니다. 13B 기본 모델의 Fimbulvetr-11B 파인튜닝도 더 적은 리소스 예산으로 산문의 풍부함에서 탁월합니다.

챕터 전반에 걸쳐 캐릭터 목소리의 불일치를 어떻게 처리합니까?

시스템 프롬프트에 상세한 캐릭터 시트(이름, 배경, 말투 패턴, 동기)를 제공하십시오. 각 새 챕터에서 다음으로 시작하십시오: "당신은 [캐릭터]로 글을 쓰고 있습니다. 다음 목소리와 관점을 유지하십시오..." 그런 다음 캐릭터 시트를 붙여넣으십시오. 이는 500-2,000단어 섹션에서 일관성을 유지합니다.

양자화(Q4, Q5, Q8)가 창작 글쓰기에서 눈에 띕니까?

네, 측정 가능하게 차이가 납니다. FP16(완전 정밀도)과 Q8은 거의 동일한 산문을 생성합니다. Q5는 미묘한 평탄화를 가져옵니다 -- 덜 고유한 형용사, 약간 반복적인 문구(사용자의 5-10%가 인지). Q4는 명확한 품질 저하를 만듭니다: 일반적인 묘사, 감각적 세부 사항 누락. 소설의 경우 Q5_K_M이 최소 권장 사항이며, Q8_K_M이 이상적입니다.

로컬 LLM을 내 글쓰기 스타일로 파인튜닝할 수 있습니까?

네. .jsonl 형식(입력/출력 쌍)으로 500-2,000개의 산문 예제를 수집한 다음, 24 GB GPU에서 Unsloth 또는 Axolotl 라이브러리를 사용하여 13B 모델을 4-8시간 동안 파인튜닝하십시오. 비용: 클라우드 GPU 기준 약 $5-15. 결과: 당신의 목소리를 모방하는 모델. LoRA(저랭크 적응) 파인튜닝은 전체 파인튜닝보다 빠르고 저렴합니다.

창작 글쓰기와 창작 *대화* 품질의 차이는 무엇입니까?

대화는 더 타이트한 단어 경제성과 뚜렷한 캐릭터 목소리를 요구하며, 산문은 감각적 풍부함과 서사적 흐름을 요구합니다. Llama 3.3 70B는 두 가지 모두에서 탁월합니다. 소형 모델(7B, 8B)은 종종 평범하고 일반적인 대화를 생성합니다. 대화 중심 소설에 집중한다면 산문 품질보다 강력한 지시 이행 능력을 갖춘 모델을 우선시하십시오; Mistral Small의 대화 품질은 Llama 8B와 맞먹습니다.

전체 소설 개요에 얼마나 많은 컨텍스트(토큰)가 필요합니까?

80,000단어 소설의 상세 개요(줄거리, 캐릭터, 챕터, 갈등)는 일반적으로 3,000-6,000 토큰입니다. 128K 컨텍스트 모델(Llama 3.2, Phi-4)을 사용하면 한 세션에서 전체 개요와 이전 챕터를 로드할 수 있습니다. 4K-8K 컨텍스트 모델의 경우 롤링 요약을 제공하십시오: 이전 챕터 요약 + 다음 3개 챕터 개요.

창작 글쓰기에 최적화된 로컬 LLM을 실행하려면 GPU가 필요합니까?

아니요, 하지만 GPU는 생성 속도를 크게 향상시킵니다. CPU(8코어)의 13B 모델: 초당 10-15 토큰. 10GB GPU(RTX 3060)의 동일한 모델: 초당 80-100 토큰. 반복적인 창작 글쓰기(변형 테스트, 다시 쓰기)의 경우 GPU는 세션 시간을 2시간에서 15분으로 단축합니다. CPU는 일회성 생성이나 개요 작성에 적합합니다.

SF 세계 구축과 스토리텔링에 가장 좋은 로컬 LLM은 무엇입니까?

50페이지 이상의 개요에서 일관성을 위해 Llama 3.3 70B를 사용하십시오. 기술적 정확성(물리학, 궤도 역학, 화학)을 위해서는 Qwen3 14B-32B를 사용하십시오. 풍부한 묘사적 세계 세부 사항을 위해서는 Fimbulvetr-11B를 사용하십시오. 예산이 제한된 설정에서는 Mistral Small 3.1 24B가 세계 일관성과 리소스 사용의 균형을 맞춥니다. 결정 전에 샘플 세계 묘사로 세 모델 모두 테스트하십시오.

창작 글쓰기, 소설, 그리고 장편 소설 집필을 위한 최고의 로컬 LLM은 무엇입니까?

Llama 3.3 70B(40 GB)는 가장 풍부한 산문과 가장 넓은 문체 범위를 제공합니다. 16 GB VRAM에서는 Mistral Small 3.1 24B(14 GB)가 장편 콘텐츠에서 좋은 일관성과 함께 강력한 서사 품질을 제공합니다. 8 GB 예산에서는 Llama 3.3 8B가 단편 소설(최대 500단어)을 처리합니다. Fimbulvetr-11B와 같은 커뮤니티 파인튜닝 모델은 더 적은 리소스 예산으로 소설 특화 학습을 추가합니다.

8GB VRAM만으로 글쓰기에 가장 적합한 로컬 LLM은 무엇입니까?

Llama 3.3 8B Q4_K_M(~6 GB)이 8 GB VRAM에서 창작 글쓰기에 가장 적합한 선택입니다. 자연스러운 산문으로 단편 소설(최대 500단어)을 안정적으로 처리합니다. Mistral Small은 더 빠르지만 더 평탄한 창작 결과물을 생성합니다. Qwen3 7B는 기술 콘텐츠에서는 뛰어나지만 서사적 유창함이 부족합니다. 8 GB에서는 모델이 더 느리게 실행된다는 점을 받아들이십시오. 이 티어에서는 창작 품질이 속도보다 중요합니다.

시(poetry)에 가장 적합한 로컬 LLM은 무엇입니까?

자유시와 이미지가 풍부한 시에는 Llama 3.3 70B가 가장 폭넓은 문학적 기법을 제공합니다. 형식이 엄격한 시(소네트, 하이쿠, 빌라넬)의 경우, 소설 특화 파인튜닝 모델 대신 기본 모델을 사용하고 온도를 0.7-0.85로 낮추십시오 -- Fimbulvetr와 같은 파인튜닝 모델은 운문이 아닌 서사 산문으로 훈련되었으며, 소설에 도움이 되는 더 높은 창작 온도는 운율과 라임을 오히려 깨뜨리는 경우가 더 많습니다.

창작 글쓰기를 위해 LM Studio에서 어떤 모델을 로드해야 합니까?

RAM 수준에 따라 Llama 3.3 70B, Mistral Small 3.1 24B, 또는 Llama 3.3 8B 중 동일한 순위가 적용됩니다. LM Studio와 Ollama는 동일한 GGUF 양자화 파일을 실행하므로 별도의 "LM Studio 모델"은 존재하지 않습니다 -- LM Studio 내장 모델 브라우저에서 모델 이름을 검색하거나(또는 Hugging Face에서 GGUF를 다운로드하여) 바로 로드하십시오. Fimbulvetr-11B와 같은 커뮤니티 파인튜닝 모델도 LM Studio의 모델 브라우저에서 로드할 수 있습니다.

창작 글쓰기와 소설 집필에 가장 적합한 Ollama 모델은 무엇입니까?

최고의 산문 품질(40 GB RAM)을 원한다면 ollama run llama3.3:70b, 16 GB RAM 티어에는 ollama run mistral-small3.1, 8 GB RAM에는 ollama run llama3.2를 사용하십시오. 소설 및 스토리 집필에 특화하려면 Fimbulvetr-11B와 같은 커뮤니티 파인튜닝 모델(커스텀 Ollama Modelfile로 로드)이 지속적인 서사 작업에서 기본 모델을 능가합니다.

GLM-4는 창작 글쓰기에 좋은 선택입니까?

GLM-4(Zhipu AI의 오픈 웨이트 모델 계열)는 특히 중국어 워크플로우나 롤플레이 사용 사례에서 창작 글쓰기를 위해 테스트해볼 만한 또 다른 옵션입니다. 영어 산문 품질 면에서 Llama 3.3이나 Mistral Small과 여기서 직접 비교 평가되지는 않았으므로, 주력 모델을 교체하기 전에 직접 샘플 프롬프트로 테스트해 보십시오.

출처

창작 글쓰기 프롬프팅의 흔한 실수

  • 구체적인 목표에 일반적인 프롬프트 사용: "이야기를 써주세요"는 일반적인 출력을 생성합니다. 대신: "절도 장면의 800단어 오프닝을 쓰십시오. 주인공이 금고가 이미 비어있다는 것을 발견합니다. 그녀의 감정적 반응을 물리적 묘사를 통해 말하지 말고 보여주십시오."
  • 양자화 효과 무시: 완전 정밀도와 동일한 산문 품질을 기대하며 Q4로 13B 모델을 실행하는 것. Q4는 눈에 띄게 산문을 평탄화합니다. 창작 글쓰기에는 최소 Q5_K_M을, 출판 가능한 품질에는 Q8을 사용하십시오.
  • 온도 및 샘플링 매개변수 무시: 창작 작업에 기본 온도(0.7-0.8)를 사용하는 것. 더 다양하고 흥미로운 산문을 위해 0.95-1.1로 높이고 top_p를 0.85-0.9로 설정하십시오. 너무 높으면(>1.2) 비일관적인 출력이 발생합니다.
  • 컨텍스트 감소 무시: 한 대화에서 2,000-4,000 토큰 이후, 70B 모델조차도 초기 캐릭터 세부 사항을 잃어버립니다. 정기적으로 캐릭터 요약을 다시 소개하거나 새 세션을 시작하십시오.
  • 로컬 모델을 클라우드 모델처럼 취급: Claude 4 같은 클라우드 모델은 장편 계획과 다단계 작업에서 탁월합니다. 로컬 모델은 엄격한 프롬프트를 사용한 장면별 생성에서 탁월합니다. 실행에는 로컬을, 개요 작성에는 클라우드를 사용하십시오.

A Note on Third-Party Facts

This article references third-party AI models, benchmarks, prices, and licenses. The AI landscape changes rapidly. Benchmark scores, license terms, model names, and API prices can shift between the time of writing and the time you read this. Before making deployment or compliance decisions based on this article, verify current figures on each provider’s official source: Hugging Face model cards for licenses and benchmarks, provider websites for API pricing, and EUR-Lex for current GDPR and EU AI Act text. This article reflects publicly available information as of May 2026.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Download the PromptQuorum Beta →

← Back to Local LLMs