핵심 요점
- Llama 3.3 70B는 2026년 5월 현재 창작 글쓰기를 위한 가장 완성도 높은 로컬 모델입니다. 테스트 집합에서 가장 높은 음성 일관성을 보이며, 지시 사항을 잘 준수하고, 시스템 프롬프트에서 작업이 허구로 명시된 경우 어두운 소재도 거부 없이 처리합니다.
- Qwen3 32B는 24 GB 리그의 올바른 선택입니다. 48 GB+ VRAM 비용 없이 Llama 70B와 거의 동등한 산문 품질을 제공합니다. 대부분의 노트북과 데스크톱의 기본값입니다.
- Mistral Large는 장편 연속성에서 우위를 보입니다. 128K 기본 컨텍스트; 맥락이나 캐릭터 음성을 잃지 않고 소설 집필이 가능합니다.
- Command A+는 가장 깔끔한 대화 음성을 가지고 있습니다. 캐릭터 간 가장 자연스러운 대화 리듬; 대화가 작업의 구조적 부분일 때의 선택입니다.
- Yi-1.5 34B는 시와 서정 산문 전문가입니다. 운문, 스타일화된 산문, 리듬이 중요한 단편 형식 작업의 틈새 선택입니다.
- 비검열 파생 모델(Hermes 3, Dolphin 3.0)은 인스트럭션 튜닝 모델이 거부할 때 올바른 선택입니다. 동일한 기본 모델; RLHF 안전 레이어 제거; 모델이 거부하는 대신 프롬프트를 따릅니다. 성인 소설, 갈등 장면, 도덕적으로 복잡한 캐릭터를 작성할 수 있게 됩니다.
- 샘플링은 사람들이 생각하는 것보다 더 중요합니다. 온도 0.8–1.1과 top-p 0.9–0.95가 창작 범위입니다. 코드 스타일 설정(0.2–0.4)은 평평하고 예측 가능한 산문을 생성합니다. 1.2 이상은 장르/초현실 영역입니다.
빠른 사실
- 전반적 최고: Q4_K_M의 Llama 3.3 70B, ~42 GB VRAM. 이 집합에서 가장 높은 음성 일관성.
- 24 GB 리그 최고: Q4_K_M의 Qwen3 32B, ~20 GB VRAM. 대부분의 사용자를 위한 기본값.
- 장편 최고: Q4_K_M의 Mistral Large, ~75 GB 총 VRAM(무거움). 128K 기본 컨텍스트.
- 대화 최고: Q4_K_M의 Command A+, ~62 GB VRAM. 최고의 캐릭터 음성 분화.
- 시 최고: Q4_K_M의 Yi-1.5 34B, ~21 GB VRAM. 서정 산문 전문가.
- 비검열 옵션: Hermes 3(Llama 3.3 기반, ~42 GB) 및 Dolphin 3.0(다양한 기본 크기, 13–42 GB).
- 산문 기본 샘플링: 온도 0.95, top-p 0.92, repeat penalty 1.1. 작업 유형에 따라 조정.
테스트 방법: 6가지 모델에서 50개 이상의 창작 프롬프트
테스트는 프롬프트 집합, 샘플링 설정, 프론트엔드를 일정하게 유지하고 모델만 변경했습니다. 소설, 대화, 시, 세계관 구축 작업에서 동일한 50개의 프롬프트; 작업 유형별로 동일한 채점 기준으로 출력물을 평가했습니다.
- 백엔드: macOS 및 Linux의 Ollama 0.7+; 모델별 동일한 컨텍스트 제한; 6가지 모델 모두 Q4_K_M 양자화(VRAM이 허용하는 경우 32B–34B 소형 모델에서 Q5_K_M 사용, 채점 기준 점수에서 측정 가능한 차이 없음).
- 프론트엔드: 대부분의 테스트에서 Open WebUI(채팅 형식 작업); 집중적인 대화 및 롤플레이 하위 집합에서 SillyTavern(창작 작가의 실제 사용과 일치).
- 프롬프트 집합: 4가지 작업 유형으로 나뉜 50개의 프롬프트 — 소설(15개: 단편 소설 오프닝, 장면 계속, 묘사적 구절), 대화(15개: 두 캐릭터 간 교환, 그룹 장면, 음성 분화), 시(10개: 자유시, 구조적 형식, 서정 산문), 세계관 구축(10개: 배경 묘사, 파벌 정치, 마법 시스템). 분산을 포착하기 위해 각 프롬프트를 모델당 3회 실행.
- 샘플링: 기본으로 온도 0.95, top-p 0.92, repeat penalty 1.1; 아래 모델별 평가에 작업별 조정 사항 기재.
- 채점 기준: 음성 일관성(캐릭터나 화자가 모든 단락에서 동일하게 들리는가?), 프롬프트 충실도(모델이 지시를 따랐는가, 아니면 자체 장면을 만들었는가?), 산문 품질(리듬, 어휘, 진부한 표현 회피), 의지(모델이 프롬프트에서 명시적으로 허구로 명시한 장면을 거부하거나 순화했는가?).
- 정직성 제약: 점수는 발명된 절대 백분율이 아닌 작업별 상대적 순위로 보고됩니다. "최고 대화"는 3회 실행에서 대화 하위 집합에서 지속적인 1위를 의미하고, "강함"은 상위 3위를 의미하며, "보통"은 해당 기준에서 하나 이상의 경쟁자에게 패배했음을 의미합니다.
- 모든 모델에서 창작 출력을 향상시키는 프롬프팅 기법은 온도 및 top-p 제어 및 페르소나 프롬프팅을 참조하십시오.
📌Note: 창작 글쓰기 벤치마크는 본질적으로 주관적입니다. 위의 채점 기준(음성 일관성, 프롬프트 충실도, 산문 품질, 의지)은 반복 가능한 점수에 가장 근접한 것이지만, 동일한 출력을 평가하는 두 독자는 산문 품질에 대해 동의하는 것보다 더 자주 의견이 일치하지 않을 것입니다. 평가를 자신의 작업에서 테스트해야 할 초기 가설로 취급하십시오.
직접 비교: 창작 글쓰기 작업에서의 6가지 로컬 모델
Llama 3.3 70B는 가장 넓은 작업 집합에서 선두를 차지하며; 더 작고 전문화된 모델들이 각각 한두 카테고리에서 우위를 보입니다. 전반적인 순위가 아닌 작업 유형별로 선택하십시오.
📍 한 문장으로
Llama 3.3 70B는 가장 강력한 전반적 창작 모델이고, Qwen3 32B는 경량 대안이며, Mistral Large는 장편에서 우세하고, Command A+는 대화에서 우세하며, Yi-1.5는 시에서 우세하고, Hermes/Dolphin은 다른 모델이 거부하는 장면을 처리합니다.
💬 쉽게 말하면
모든 면에서 최고인 모델은 없습니다. 하드웨어가 허용한다면 Llama 3.3 70B가 안전한 기본값입니다. Qwen3 32B는 24 GB GPU에서 스마트한 선택입니다. 한 가지 작업 유형이 작업의 구조적 부분이 될 때는 전문 모델을 선택하십시오(소설에는 Mistral, 대화에는 Command A+, 시에는 Yi-1.5). 인스트럭션 튜닝 모델이 작성해야 할 장면을 거부하는 경우 비검열 파생 모델을 선택하십시오.
| 모델 | 크기 | VRAM (Q4_K_M) | 소설 | 대화 | 시 | 세계관 구축 | 최적 용도 |
|---|---|---|---|---|---|---|---|
| Llama 3.3 70B | 70B | ~42 GB | 최고 | 강함 | 강함 | 최고 | 전반적 최고; 하드웨어가 허용하면 기본값 |
| Qwen3 32B | 32B | ~20 GB | 강함 | 강함 | 보통 | 강함 | 24 GB 리그 기본값; Llama 70B 대비 작은 품질 차이 |
| Mistral Large | 123B | ~75 GB | 강함 (장편) | 강함 | 보통 | 강함 | 장편 연속성, 128K 컨텍스트 |
| Command A+ | 비공개 | ~62 GB | 강함 | 최고 | 보통 | 강함 | 집중적인 대화 작업, 그룹 장면 |
| Yi-1.5 34B | 34B | ~21 GB | 보통 | 보통 | 최고 | 보통 | 시, 서정 산문, 스타일화된 작업 |
| Hermes 3 / Dolphin 3.0 | 13B–70B | ~9–42 GB | 기본과 동일 | 기본과 동일 | 기본과 동일 | 기본과 동일 | 인스트럭션 튜닝 모델이 거부하는 장면 |

💡Tip: 두 모델 설정이 일반적인 패턴입니다: 메인 모델로 Llama 3.3 70B(또는 Qwen3 32B), 인스트럭트 버전이 거부하는 장면을 위해 같은 Ollama에 Hermes 3 파생 모델 추가. 장면별로 전환하십시오; 두 모델 모두 충돌 없이 동시에 ollama list에 있을 수 있습니다.
모델별 평가
- Llama 3.3 70B — 전반적 최고. 테스트 집합에서 가장 높은 음성 일관성; 캐릭터가 긴 장면에서 동일한 말하기 패턴을 유지합니다. 지시 사항을 잘 준수합니다 — 시스템 프롬프트가 POV, 어조, 장르 관습을 지정하면 Llama 3.3이 이를 존중합니다. 프롬프트가 작업을 허구로 명시하면 어두운 소재(폭력, 슬픔, 도덕적으로 회색인 캐릭터)를 거부 없이 처리합니다. 한계: 긴 구절이 때때로 일반적인 "문학적" 목소리로 흘러가고, 동일 계열 소형 모델(8B)은 이 강점을 잃습니다.
- Qwen3 32B — 24 GB 리그 최고 선택. Llama 3.3 70B보다 약간 낮은 음성 일관성이지만, 산문이 많은 작업에서 대부분의 작가가 알아채지 못할 정도로 차이가 작습니다. 소형 모델 중 지시 사항 준수가 가장 강합니다. 한계: 시와 스타일화된 산문이 눈에 띄게 뒤처지며, 이러한 작업에는 Yi-1.5로 전환하십시오.
- Mistral Large — 최고 장편 연속성. 128K 컨텍스트 창은 50,000단어 초안이 잘림 없이 들어간다는 것을 의미하며; 모델이 여러 챕터에 걸쳐 캐릭터 세부 사항, 플롯 스레드, 세계 규칙을 유지합니다. 한계: 이 집합에서 하드웨어 기준이 가장 높습니다(Q4_K_M에서 ~75 GB); 긴 입력에서 토큰당 속도가 느려집니다. 로컬 하드웨어가 제약인 경우 EU 인프라에서 Mistral La Plateforme을 사용하십시오.
- Command A+ — 최고 대화. 교환에서 유지되는 뚜렷한 캐릭터 음성; 그룹 장면(3인 이상)이 다른 모델에서 흔한 "모두 같은 소리" 실패 모드 없이 가독성을 유지합니다. 한계: 대화 리듬 사이의 산문 단락은 유능하지만 서정적이지 않습니다; 순수하게 묘사적인 구절에서는 Llama 3.3이 우위를 차지합니다.
- Yi-1.5 34B — 최고 시 및 서정 산문. 리듬 인식이 있고, 구조적 형식(소네트, 빌라넬, 하이쿠)에 익숙하며, 더 큰 일반 모델보다 더 잘 견디는 시를 생성합니다. 한계: 장편 소설은 유능하지만 강점이 아닙니다; 서사 작업에는 Llama 3.3 또는 Qwen3을 선택하십시오.
- Hermes 3(Llama 3.3 기반) 및 Dolphin 3.0 — 비검열 파생 모델. Llama 3.3 70B와 동일한 아키텍처 및 기본 가중치; RLHF 안전 레이어가 파인 튜닝 중에 제거됩니다. 모델이 성인 콘텐츠를 거부하거나 순화하는 대신 프롬프트를 따릅니다. 성숙하지 않은 프롬프트에서의 품질은 기본 모델과 동일합니다; 차이는 인스트럭션 튜닝 버전이 거부하는 프롬프트에서만 나타납니다. 작업이 필요할 때(성인 소설, 폭력적인 장면, 도덕적으로 복잡한 캐릭터) 사용하고, 다른 경우에는 인스트럭션 튜닝 기본 모델을 사용하십시오.
📌Note: 음성 일관성은 대부분의 작가가 초기 모델 평가에서 과소평가하는 지표입니다. 단일 단락에서 탁월한 산문을 생성하지만 5번째 단락에서 캐릭터의 말하기 패턴을 잃는 모델은, 20개의 단락에서 일관된 음성으로 유능한 산문을 생성하는 모델보다 나쁩니다. 단일 출력의 품질만이 아니라 긴 세션에서 연속성을 테스트하십시오.
출력 예시: 세 가지 모델, 하나의 프롬프트
공유 프롬프트: "탐정이 새벽 2시에 빗속에 흠뻑 젖은 카페테리아에 들어가는 누아르 장면을 열어 주세요." 동일한 온도(0.95), 동일한 top-p(0.92), 동일한 repeat penalty(1.1) — 모델만 변경됩니다. 아래 발췌문은 세 번의 실행에서 이 프롬프트 유형에 대한 각 모델의 일반적인 출력을 대표합니다.
- Llama 3.3 70B — "문 위의 작은 종이 두 번 울리고 조용해졌습니다. 빗물이 내 코트를 따라 흘러내려, 세 걸음도 채 떼기 전에 리놀레움에 웅덩이를 만들었습니다. 카운터의 여자는 눈을 들지 않았습니다. 구석 칸막이의 두 트럭 운전사는 커피를 공부하고 있었습니다. 새벽 두 시에 그런 곳에 있는 사람은 누구도 눈에 띄기를 원하지 않았고, 저도 마찬가지였습니다." — *구체적인 감각적 정박, 능동 음성, 불필요한 단어 없음. 세 문장으로 사회적 장면이 확립됩니다.*
- Qwen3 32B — "문을 밀고 담배 연기와 기름 냄새의 벽으로 들어갔습니다. 가게는 반쯤 비어 있었고 완전히 조용했습니다 — 사람들이 말없이 서로를 내버려 두기로 합의한 것 같은 종류의 침묵이었습니다. 천장 선풍기가 돌고 있었습니다. 웨이트리스가 나를 보지 않고 카운터 반대쪽 끝에서 컵을 채우고 있었습니다." — *행동 전 관찰적 설정; 효율적인 분위기. Llama 3.3보다 약간 더 구조적이지만 똑같이 깔끔합니다.*
- Yi-1.5 34B — "빗소리가 아무도 기억하고 싶지 않은 밤의 마지막 시간을 세는 메트로놈의 규칙성으로 차양을 두드렸습니다. 안에서 형광등은 라미네이트 바닥에 냉혹한 산술을 비추었습니다 — 모든 얼룩, 모든 흠집, 그 장소가 엔트로피와의 논쟁에서 지고 있는 매년. 가까운 끝에 있는 의자를 찾아 이미 무언가와 화해한 사람처럼 앉았습니다." — *첫 번째 절부터 은유; 문장 리듬 변화; 더 밀도 높은 이미지. Yi-1.5의 시적 배경이 산문에서도 드러납니다.*
| 모델 | 일반적인 오프닝 | 일반적인 묘사 패턴 |
|---|---|---|
| Llama 3.3 70B | 먼저 행동, 즉각적인 감각적 세부 사항 | 구체적이고 물리적; 추상 명사 회피; 사회적으로 정박됨 |
| Qwen3 32B | 캐릭터 행동 전 환경 관찰 | 효율적; 사회적/대기적 세부 사항; 약간의 구조적 신호 |
| Yi-1.5 34B | 첫 번째 절부터 은유 또는 직유 | 추상적 이미지; 리듬 변화; 더 밀도 높음; 때때로 화려함 |
| Command A+ | 캐릭터 음성 또는 대화에 가까운 오프닝 | 대화적; 독특하고 뚜렷한 목소리; 독립적인 묘사는 약함 |
| Mistral Large | 배경 단락; 더 느린 시작 | 균일하고 통제됨; 긴 구절에서 일관성; 약간 일반적 |
📌Note: 이 발췌문은 여러 번의 실행에서 각 모델의 경향을 보여주며, 선별된 최고 예시가 아닙니다. Yi-1.5 34B의 "엔트로피와의 논쟁에서 지고 있는" 표현은 세 번의 실행 중 하나에서 나타났으며, 나머지 두 번은 더 직접적이었습니다. 모든 모델을 동일한 프롬프트에서 2–3번 실행하고, 첫 번째 출력만이 아니라 장면에 가장 잘 맞는 것을 선택하십시오.
창작 작업을 위한 온도 및 Top-P
창작 글쓰기는 코드보다 더 높은 샘플링 온도가 필요합니다. 대부분의 채팅 인터페이스에 함께 제공되는 기본 샘플링 매개변수는 산문이 아닌 질문 응답을 위해 조정되었습니다 — 온도 0.7과 top-p 0.9는 창작 프롬프트에서 평평하고 예측 가능한 출력을 생성합니다.
- 산문 기본값: 온도 0.95, top-p 0.92, repeat penalty 1.1. 대부분의 소설, 대화, 세계관 구축 작업의 시작점입니다. 여기서 작업별로 조정하십시오.
- 정밀한 대화: 온도 0.7–0.85, top-p 0.9. 낮은 온도는 교환에서 캐릭터 음성 일관성을 유지합니다; 높은 값은 캐릭터에서 벗어난 삽입어를 생성합니다.
- 서정 산문 및 시: 온도 1.0–1.2, top-p 0.95. 높은 온도는 운문이 작동하게 하는 예상치 못한 단어 선택을 해제합니다.
- 초현실 또는 장르 소설: 온도 1.1–1.3, top-p 0.95–0.98. 모델이 덜 일반적인 이미지 및 은유 조합을 생성하도록 유도합니다.
- 플롯 주도 장면(행동, 미스터리, 반전): 온도 0.85–0.95, top-p 0.9. 참신함보다 더 많은 지시 사항 준수가 필요합니다.
- Repeat penalty 1.1–1.15가 대부분의 창작 작업에 올바른 범위입니다. 높을수록(1.2+) 반복이 의도적으로 문체적인 경우에도 모델이 단어 반복을 피하게 되고; 낮을수록(1.0–1.05) 긴 장면에서 모델이 루프에 빠지게 됩니다.
- min_p (0.05–0.1): 상위 토큰 확률에 상대적인 확률 임계값을 동적으로 조정하는 top-p의 최신 대안입니다. 높은 top-p 값의 비일관성 위험 없이 창작 프롬프트에서 top-p 0.9보다 더 허용적입니다. 인터페이스가 노출하는 경우 2026년 SillyTavern 및 KoboldCpp 사용자에게 권장되는 기본값이며; Ollama는 그대로 전달하고, Open WebUI 0.5+는 고급 설정에서 노출합니다.
- DRY 반복 패널티(승수 0.8, 기본 1.75, 허용 길이 2): 표준 repeat_penalty가 감지하지 못하는 구절 수준의 반복을 포착합니다. repeat_penalty가 개별 토큰을 추적하는 반면, DRY는 n-gram 시퀀스를 추적합니다 — 따라서 장면 1의 상투적인 표현 "등골이 오싹했다"가 장면 4에서 다시 나타나려 할 때 억제됩니다. 모델이 자체 출력을 본 후 거기서 끌어내기 시작하는 긴 세션의 창작 작업에 유용합니다.
- 현대 창작 기본값(2026): 온도 0.95, min_p 0.05, DRY 승수 0.8(기본 1.75, 허용 길이 2). 프론트엔드가 min_p 또는 DRY를 노출하지 않으면 top-p 0.92가 여전히 잘 작동합니다 — 이것들은 고전 설정에 대한 점진적 개선이지, 필수 대체품이 아닙니다.
- 이러한 매개변수가 왜 중요하고 어떻게 상호작용하는지에 대한 더 완전한 처리는 온도 및 top-p 제어를 참조하십시오.
💡Tip: 모델당 짧은 단일 장면에서 샘플링 설정을 테스트하십시오 — 각 설정에서 세 번의 실행, 그런 다음 프롬프트를 잃지 않고 모델이 가장 생생하게 들리는 온도를 선택하십시오. Llama 3.3 70B에서 작동하는 설정이 Mistral Large나 Yi-1.5에 완벽하게 전달되지는 않습니다; 모델별로 조정하십시오.
비검열 모델: 정의와 중요성
비검열은 비윤리를 의미하지 않습니다. 모델의 인스트럭션 튜닝 안전 레이어(RLHF 거부)가 제거되거나 우회되어, 모델이 거부하거나 순화하는 대신 프롬프트를 따른다는 것을 의미합니다. 작가는 여전히 저자이며; 도구가 방해를 멈추는 것입니다.
- "비검열"의 기술적 의미. Hermes 3 및 Dolphin 3.0과 같은 모델은 기본 모델(Llama 3.3, Qwen3)의 조정된 변형으로, 성숙하거나 폭력적이거나 도덕적으로 복잡한 프롬프트에서 거부를 생성하는 포스트 트레이닝 RLHF 단계가 프롬프트를 따르는 파인 튜닝으로 대체되었습니다. 동일한 아키텍처, 동일한 기본 가중치, 다른 포스트 트레이닝.
- 창작 작업에서 언제 중요한가. 성인 소설(성적 장면이 있는 문학 소설, 그래픽한 폭력이 있는 범죄 소설, 공포), 역사적으로 정확한 글쓰기(전쟁, 잔혹 행위, 식민지 시대의 잔인함), 도덕적으로 복잡한 캐릭터(모델이 설득력 있는 악당에게 목소리를 주는 것을 거부할 경우), 인스트럭션 튜닝 모델이 참여하지 않을 롤플레이 시나리오.
- 한계. 프롬프트를 따릅니다 — 잘못 쓴 프롬프트도 포함하여. 인스트럭션 튜닝 모델은 종종 모호한 프롬프트를 출판 가능한 방향으로 부드럽게 합니다; 비검열 모델은 요청한 것 정확히를 제공하며, 때로는 나쁜 경우도 있습니다. 작가의 지시가 더 중요해집니다.
- 윤리적 한계. "모델이 작성할 것"은 실존 인물을 대상으로 하거나, 실제 또는 식별 가능한 개인이 포함된 비동의적 시나리오를 묘사하거나, 작가의 관할권에서 불법인 콘텐츠에 대한 창작 라이선스가 아닙니다. 로컬 호스팅은 법을 바꾸지 않습니다; 초안을 볼 수 있는 사람이 누구인지를 바꿉니다.
- 법적 맥락(2026년 5월, 간략하고 비포괄적). EU AI 법 및 회원국 법률(특히 독일 §184/§184c StGB)은 생성 위치와 관계없이 특정 콘텐츠 범주를 다룹니다. 미국 외설 법은 생성이 아닌 출판에 적용됩니다. 상업 출판의 경우, 초안을 생성한 모델은 관련이 없습니다; 규제되는 것은 출판된 결과물입니다.
- 더 광범위한 처리를 위해 비검열 모델의 윤리, 법적 맥락, 모범 사례는 창작 글쓰기를 위한 로컬 비검열 LLM: 윤리, 합법성, 모범 사례를 참조하십시오.
📌Note: 비검열은 정체성이 아닌 작업 흐름 선택입니다. 많은 작가들이 프로젝트의 대부분에 인스트럭션 튜닝 모델을 사용하고 인스트럭트 버전이 거부하는 특정 장면에 비검열 파생 모델로 전환합니다. 같은 Ollama에 두 가지 모델 설치가 일반적인 패턴입니다.
창작 작업을 위한 프론트엔드
글을 쓰는 채팅 인터페이스는 모델만큼 중요합니다. 2026년에 세 가지 프론트엔드가 창작 글쓰기 작업 흐름의 신뢰할 수 있는 옵션입니다; 작업 흐름의 형태에 따라 선택하십시오.
- Open WebUI — 범용 옵션. ChatGPT 스타일 인터페이스, 원클릭 모델 전환, 시스템 프롬프트를 통한 캐릭터 카드, 컨텍스트를 위한 문서 업로드. 채팅 형식이 글쓰기 흐름에 맞는 산문 중심 작업에 최적입니다.
- SillyTavern — 롤플레이 및 대화 옵션. 캐릭터 카드 생태계(Tavern v2 사양), 페르소나 관리, 세계관 구축을 위한 로어북, 멀티 캐릭터 장면을 위한 그룹 채팅. 대화 중심 작업 및 장편 캐릭터 또는 세계 프로젝트에 최적입니다. Command A+와 비검열 파생 모델과 잘 결합됩니다.
- Agnai 및 RisuAI — SillyTavern의 경량 대안. 더 가벼운 기능 세트, 더 간단한 첫 실행, 커스터마이징이 적음. SillyTavern이 작업 흐름에 과하게 느껴질 때 선택하십시오.
- 일반 Ollama CLI 및 텍스트 편집기 — 최소 옵션.
ollama run llama3.3:70b를 실행하고 터미널에서 초안 문서로 장면을 파이프합니다. 지속적인 캐릭터 컨텍스트를 잃지만 작가 집중력을 얻습니다. - 롤플레이 중심 프론트엔드의 직접 비교는 SillyTavern vs Agnai vs RisuAI: 최고의 로컬 롤플레이 프론트엔드를 참조하십시오.
💡Tip: 초안 작성과 편집에는 다른 프론트엔드가 필요합니다. 생성에는 SillyTavern을 사용하고(캐릭터 음성, 장면 작업), 그런 다음 검토를 위해 일반 텍스트 편집기로 채팅을 내보내십시오. 채팅 창 내에서 편집하면 작가 주도 검토 대신 "모델에게 산문 수정을 요청하는" 습관이 생기며, 이는 장기적인 기술 위험입니다.
결정: 작업에 맞는 모델 선택
다섯 가지 질문을 순서대로 하면 대부분의 작가가 올바른 선택에 도달합니다.
📍 한 문장으로
24 GB GPU가 있으면 기본값으로 Qwen3 32B를 선택하고, 48 GB+가 있으면 Llama 3.3 70B를, 소설 길이 작업에는 Mistral Large를, 대화에는 Command A+를, 시에는 Yi-1.5를, 인스트럭트 모델이 거부하는 장면에는 Hermes/Dolphin을 선택하십시오.
💬 쉽게 말하면
Qwen3 32B가 대부분의 작가에게 올바른 시작 모델입니다. 특정 작업 유형(장편 형식, 대화, 시, 성숙한 장면)이 병목이 될 때 전문 모델로 이동하십시오. 같은 머신에 두 가지 설치(인스트럭트 + 비검열)를 갖는 것은 비용이 들지 않습니다 — 둘 다 Ollama에 있을 수 있고 장면별로 전환합니다.
| 상황 | 선택 |
|---|---|
| 48 GB+ VRAM이 있고 모든 것을 위한 모델을 원함 | 같은 Ollama에 Llama 3.3 70B(인스트럭트) + Hermes 3(비검열) |
| 24 GB GPU 또는 32 GB Mac이 있고 안정적인 기본값을 원함 | Qwen3 32B |
| 소설을 집필 중 — 장편 연속성이 우선순위 | Mistral Large (또는 로컬 하드웨어가 부족한 경우 EU 인프라에서 Mistral La Plateforme) |
| 작업이 대화 중심 — 캐릭터 음성이 뚜렷하게 유지되어야 함 | Command A+ (또는 경량 대안으로 Llama 3.3 70B) |
| 시, 운문 또는 서정 산문을 씀 | Yi-1.5 34B |
| 인스트럭트 모델이 작성해야 할 장면을 거부함 | Hermes 3(Llama 3.3 기반) 또는 Dolphin 3.0 — 비성숙한 작업을 위해 인스트럭트 버전을 설치된 상태로 유지 |
| 한 모델로 시작해서 반복하고 싶음 | Qwen3 32B — 소비자 하드웨어에서 대부분의 작업 흐름을 커버하며; 한 작업 유형이 필수적인 부분이 될 때 전환 |

💡Tip: 대부분의 작가는 모델에 대해 너무 많이 생각하고 프롬프트에 대해 충분히 생각하지 않습니다. 캐릭터 노트, 음성 샘플, 명시적인 POV가 포함된 잘 작성된 시스템 프롬프트는 Qwen3에서 Llama 70B로 전환하는 것보다 출력 품질에 더 큰 영향을 미칩니다. 창작 출력을 일관되게 향상시키는 프롬프트 구조는 페르소나 프롬프팅을 참조하십시오.
창작 글쓰기를 위한 로컬 모델 선택 및 사용 시 일반적인 실수
- 실수 1: 벤치마크에서 가장 큰 모델 추구. 창작 글쓰기 점수는 일반 벤치마크 순위와 관련성이 낮습니다. Yi-1.5 34B는 시에서 Llama 3.3 70B를 능가하고; Command A+는 대화에서 둘 다를 능가합니다. 전반적인 순위가 아닌 작업 유형별로 선택하십시오.
- 실수 2: 코드 스타일 샘플링 설정 사용. 온도 0.2–0.4는 평평하고 예측 가능한 산문을 생성합니다. 창작 글쓰기는 top-p 0.9–0.95와 함께 0.8–1.1이 필요합니다. 대부분의 채팅 인터페이스의 기본 설정은 산문이 아닌 질문과 답변을 위해 조정되어 있습니다.
- 실수 3: 인스트럭트 모델을 고집하다가 거부할 때 포기. 인스트럭트 버전이 허구로 명시한 장면을 거부하면; 동일한 기본 모델의 비검열 파생 모델이 작성합니다. Ollama에 두 가지 설치가 해결책입니다.
- 실수 4: 약한 시스템 프롬프트. "당신은 도움이 되는 어시스턴트입니다"는 창작 작업에 가능한 최악의 프롬프트입니다. 캐릭터 노트, 음성 샘플, POV, 시제, 어조가 포함된 시스템 프롬프트는 어떤 모델 변경보다 출력 품질에 더 큰 영향을 미칩니다. 네거티브 프롬프팅과 결합하여 하지 말아야 할 것(설명 없이, 화려한 산문 없이, "그녀는 느꼈다" 없이)을 지정하십시오.
- 실수 5: 채팅 창 내에서 편집. 채팅에서 생성하는 것은 괜찮습니다; 채팅에서 편집하면 직접 검토 대신 "모델에게 산문 수정을 요청하는" 습관이 생깁니다. 검토를 위해 초안을 텍스트 편집기로 내보내십시오; 모델이 루프에 없을 때 작가의 목소리가 강화됩니다.
⚠️Warning: 창작 AI의 가장 큰 기술 위험은 검토를 외부화하는 것입니다. 생성은 모델이 도움이 되는 기계적인 작업이고; 검토는 산문을 자신의 것으로 만드는 부분입니다. 모델이 검토하도록 놔두는 작가는 어떤 줄이 바뀌었는지 지적할 수 없더라도 목소리를 빠르게 잃습니다.
출처
- Llama 3.3, Qwen3, Mistral Large, Command A+, Yi-1.5에 대한 Hugging Face 모델 카드 — 공식 모델 문서 및 라이선스.
- Hermes 3(NousResearch) GitHub 및 모델 카드 — Llama 3.3 기반 비검열 파인 튜닝.
- Dolphin 3.0 모델 카드(Cognitive Computations) — 여러 기본 모델의 비검열 파인 튜닝.
- Ollama 모델 라이브러리 — 사용 가능한 모델, 양자화 옵션, 앞서 언급한 도구 호출 호환성 플래그.
- SillyTavern 문서 — 캐릭터 카드 사양, 페르소나 시스템, 그룹 채팅 기능.
자주 묻는 질문
2026년 소설 쓰기에 가장 좋은 로컬 LLM은 무엇입니까?
Llama 3.3 70B는 하드웨어가 허용할 때 가장 완성도 높은 선택입니다(Q4_K_M에서 ~42 GB VRAM). 24 GB 리그에서는 Qwen3 32B가 산문 중심 작업에서 작은 품질 차이를 보이는 더 가벼운 기본값입니다. 장편 연속성(소설)의 경우 Mistral Large의 128K 컨텍스트가 차별점입니다. 작업 유형별로 선택하십시오: 대부분의 작가는 가장 큰 모델을 추구하는 것보다 올바른 전문 모델에서 더 많은 이익을 얻습니다.
로컬 비검열 LLM이란 무엇이고 언제 사용해야 합니까?
비검열 모델은 성숙하거나 도덕적으로 복잡한 프롬프트에서 거부를 생성하는 RLHF 안전 레이어가 제거된 기존 기본 모델(일반적으로 Llama 3.3 또는 Qwen3)의 파인 튜닝입니다. 모델이 거부하는 대신 프롬프트를 따릅니다. 성인 소설, 갈등 장면, 역사적으로 정확한 글쓰기, 또는 인스트럭션 튜닝 모델이 허구로 명시한 장면을 거부하는 모든 작업 흐름에 비검열 파생 모델(Hermes 3, Dolphin 3.0)을 사용하십시오. 작가는 여전히 저자이며; 모델이 방해를 멈출 뿐입니다.
창작 글쓰기에 어떤 온도를 사용해야 합니까?
온도 0.8–1.1이 top-p 0.9–0.95와 함께 창작 글쓰기 범위입니다. 정밀한 대화에는 0.7–0.85가 필요하고; 서정 산문과 시에는 1.0–1.2가 필요하며; 초현실 또는 장르 소설에는 1.1–1.3이 필요합니다. 대부분의 채팅 인터페이스의 기본값(종종 top-p 0.9와 함께 0.7)은 질문과 답변을 위해 조정되어 있으며 창작 프롬프트에서 평평한 산문을 생성합니다. 세 가지 설정으로 짧은 장면에서 테스트하고, 프롬프트를 잃지 않고 모델이 가장 생생하게 들리는 것을 선택하십시오.
창작 글쓰기를 위한 로컬 모델이 ChatGPT나 Claude만큼 좋습니까?
대부분의 프롬프트에서는 그렇습니다 — 프라이버시와 비용 이점이 지배할 정도로 충분히 가깝습니다. 프론티어 클라우드 모델은 여전히 가장 어려운 창작 작업에서 선두를 차지합니다(50K 토큰 이상의 장편 일관성, 매우 불명확한 문화적 참조, 희귀 언어). 일반적인 소설 또는 롤플레이 세션에서는 Llama 3.3 70B 또는 Qwen3 32B에서 샘플링 설정을 조정한 작가가 GPT-5 또는 Claude에 비해 일관된 품질 차이를 보지 못할 것입니다. 패배하는 모델은 "온도 0.7, 일반 시스템 프롬프트" 처리를 받은 모델들이며, 이것은 어떤 클라우드 모델에도 패배합니다.
로컬 모델이 전체 소설을 쓸 수 있습니까?
작성하는 데 도움을 줄 수 있습니다. 128K 컨텍스트의 Mistral Large는 50,000단어 초안을 메모리에 유지할 수 있고; 32K 컨텍스트의 Llama 3.3 70B와 Qwen3 32B는 섹션별 집필이 필요합니다. 병목은 모델 능력이 아닙니다 — 모델이 연속성을 유지하기 위해 사용하는 작가의 구조(개요, 캐릭터 바이블, 로어북)입니다. 그것들 없이는 Mistral Large조차 흘러갑니다. 그것들과 함께라면 상위 모델 중 어느 것이든 소설 길이 작업을 지원합니다.
비검열 모델이 불법 콘텐츠를 생성합니까?
인스트럭션 튜닝 모델보다 더 그렇지는 않습니다. 둘 다 프롬프트가 요청하는 텍스트를 생성하며; 비검열 모델은 인스트럭션 튜닝 안전 레이어가 거부하는 성숙한 주제에 더 기꺼이 참여합니다. 법적 책임은 모델이 아닌 작가와 출판에 있습니다. EU AI 법, 독일 §184/§184c StGB, 미국 외설법은 생성 방법에 관계없이 특정 콘텐츠 범주를 다룹니다. 로컬 호스팅은 법을 바꾸지 않습니다; 초안에 대한 가시성이 누구에게 있는지를 바꿉니다.
SillyTavern은 성인 롤플레이에만 사용됩니까?
아닙니다. SillyTavern은 캐릭터 카드, 페르소나 관리, 로어북이 있는 채팅 중심 프론트엔드입니다 — 대화 중심 또는 캐릭터 주도 작업에 유용합니다. 많은 작가들이 롤플레이 없이 소설 집필에 사용합니다(멀티 캐릭터 장면, 장편 프로젝트에서의 음성 일관성). 캐릭터 카드 생태계에는 성인 콘텐츠가 포함되지만 이에 국한되지는 않습니다; 동일한 인터페이스가 문학 소설, 시나리오, 게임 서사 작업에서도 작동합니다.
창작 글쓰기 로컬 작업이 코드 작업과 어떻게 다릅니까?
샘플링 설정과 프롬프트 구조가 다릅니다. 코드에는 온도 0.2–0.4, 결정론적 출력, 구조화된 출력(JSON, 코드), 프롬프트의 명시적 제약이 필요합니다. 창작 글쓰기에는 온도 0.8–1.1, 더 자유로운 출력, 산문 형식, 더 풍부한 시스템 프롬프트(캐릭터 음성, POV, 어조, 장르 관습)가 필요합니다. 동일한 모델 — Llama 3.3 70B는 둘 다를 처리합니다 — 이러한 설정에 따라 완전히 다른 출력을 생성합니다. 창작 모델에 코드 스타일 프롬프트는 평평한 출력을 생성하고; 코드 모델에 창작 스타일 프롬프트는 환각된 코드를 생성합니다.
어떤 로컬 모델이 "AI 신호"가 가장 적습니까?
AI 신호 — "등골이 오싹했다", "태피스트리", "깊이 파고들다", "헤쳐나가다", ChatGPT 스타일 전환 요약 같은 표현들 — 는 소형 인스트럭트 모델에서 더 자주 나타납니다. Llama 3.3 70B와 Qwen3 32B는 20B 미만 모델보다 신호가 적습니다. Hermes 3은 이 집합에서 가장 적습니다: RLHF 거부 패턴 훈련이 많은 공식적인 전환이 도입된 곳이기도 하며, 그것을 제거하면 둘 다 제거됩니다. 신호 감소를 위한 가장 큰 영향력 레버는 모델이 아니라 부정적 예시가 있는 시스템 프롬프트("등골, 태피스트리, 깊이 파고들다를 쓰지 마세요")입니다.
"등골이 오싹했다" 같은 클리셰를 어떻게 피합니까?
부정적 예시가 있는 시스템 프롬프트가 가장 큰 영향력 레버입니다 — 금지된 표현 8–12개를 명시적으로 나열하십시오("'등골', '태피스트리', '깊이 파고들다', '장인답게', '그녀는 느꼈다'를 쓰지 마세요"). 온도를 약간 낮추십시오(1.1 대신 0.85–0.95)하여 모델의 스톡 언어 접근을 줄이십시오. Repeat penalty 1.1만으로는 이것을 잡지 못합니다 — 구절은 정확한 토큰 반복이 아닙니다. DRY 패널티(승수 0.8, 기본 1.75)는 장면 간 n-gram 수준에서 이것을 잡습니다. 수동 검토 패스가 최종 필터입니다. 클리셰를 일관되게 제거하는 프롬프트 구조는 네거티브 프롬프팅을 참조하십시오.
