LLM이란 실제로 무엇인가
LLM(대규모 언어 모델)은 입력 토큰 시퀀스가 주어졌을 때 다음으로 가장 확률이 높은 토큰을 예측하도록 학습된 트랜스포머 기반 신경망입니다 — 데이터베이스, 검색 엔진, 또는 추론 시스템이 아닙니다. 모델은 학습 중 웹 페이지, 책, 코드 및 기타 텍스트에서 수천억 개의 단어를 처리함으로써 토큰 간의 통계적 관계를 학습합니다.
프롬프트를 입력하면 모델은 텍스트를 숫자 토큰 ID 시퀀스로 변환하고, 이를 수십 개의 트랜스포머 레이어를 통해 전달한 뒤, 전체 어휘(일반적으로 50,000–100,000개 토큰)에 대한 확률 분포를 출력합니다. 그 분포에서 토큰 하나를 샘플링하여 시퀀스에 추가하고, 정지 토큰이 생성되거나 출력 한계에 도달할 때까지 이 과정을 반복합니다.
이 아키텍처는 사용자들을 혼란스럽게 하는 여러 행동을 설명합니다: LLM이 그럴듯하지만 거짓된 사실을 "환각"하는 이유(검증된 진실이 아닌 확률적으로 그럴듯한 텍스트를 예측하기 때문), 산술 계산에 실패할 수 있는 이유(실제 계산이 아닌 토큰 패턴 때문), 그리고 프롬프트를 바꾸면 출력이 달라지는 이유(서로 다른 토큰 시퀀스가 서로 다른 확률 분포를 유발하기 때문)입니다.
| 속성 | LLM | 전통적인 소프트웨어 |
|---|---|---|
| 작동 방식 | 학습된 확률 분포를 통해 다음 토큰을 예측 | 결정론적 명령을 실행 |
| 출력 결정론 | 확률적 — 동일한 입력도 다른 출력을 생성할 수 있음 | 결정론적 — 동일한 입력은 항상 동일한 출력을 생성 |
| 지식 출처 | 학습 중 모델 가중치에 인코딩된 패턴 | 실행 시 데이터베이스 또는 파일에서 읽음 |
| 오류 유형 | 자신감 있지만 틀린 (환각) | 충돌 또는 오류 코드 반환 |
| 업데이트 방식 | 재학습 또는 파인튜닝 필요 | 코드 변경 또는 데이터베이스 업데이트 |
토크나이제이션: 텍스트가 숫자가 되는 방법
**LLM이 텍스트를 처리하기 전에 먼저 정수 토큰 ID 시퀀스로 변환해야 합니다 — 이 과정을 토크나이제이션이라고 합니다.** GPT-5.5는 자주 등장하는 서브워드 단위로 텍스트를 분할하는 BPE(Byte Pair Encoding)를 사용합니다. Claude Opus 4.8과 Gemini 3.1 Pro도 유사한 서브워드 토크나이제이션 방식을 사용합니다.
토크나이제이션은 언어에 따라 다릅니다. 영어 텍스트는 평균적으로 단어 0.75개당 토큰 1개에 해당합니다. 중국어와 일본어는 단어 0.5개당 토큰 1개에 해당합니다 — 동일한 문서가 영어보다 중국어로 작성될 때 약 두 배의 토큰이 필요하며, 이는 API 비용과 컨텍스트 윈도우 사용에 직접적인 영향을 미칩니다.
| 입력 텍스트 | 토큰 | 토큰 수 |
|---|---|---|
| "Hello, world!" | "Hello", ",", " world", "!" | 4 |
| "Tokenization" | "Token", "ization" | 2 |
| "GPT-5.5" | "G", "PT", "-", "4", "o" | 5 |
| "你好世界" (안녕하세요, 중국어) | "你好", "世界" | 모델에 따라 2–4 |
트랜스포머 어텐션 작동 방식
트랜스포머 아키텍처는 셀프 어텐션이라는 메커니즘을 사용하여 각 토큰이 자신의 표현을 계산할 때 시퀀스의 다른 모든 토큰에 얼마나 "주의를 기울여야" 하는지를 결정합니다. 각 토큰에 대해 모델은 쿼리(Q), 키(K), 값(V)이라는 세 개의 벡터를 계산하고, Q와 K의 내적으로 어텐션 점수를 계산한 뒤 소프트맥스로 스케일링 및 정규화합니다.
멀티헤드 어텐션은 이 과정을 여러 "헤드"에서 병렬로 실행합니다(GPT-5.5는 가장 큰 레이어에서 96개의 어텐션 헤드를 사용합니다). 각 헤드는 서로 다른 관계 패턴을 학습합니다. 일부 헤드는 구문적 관계(주어-동사), 다른 헤드는 의미적 유사성, 또 다른 헤드는 공참조(대명사를 명사와 연결)에 특화됩니다.
핵심적인 실제 시사점은 "중간 손실" 효과입니다. Stanford University의 Liu et al.(2023) 연구에 따르면 LLM은 긴 컨텍스트의 중간 부분에 있는 정보를 체계적으로 과소 평가합니다. 2,000 토큰을 초과하는 프롬프트의 경우 중요한 지시사항을 시스템 프롬프트(처음)에 배치하고 가장 중요한 제약 조건을 사용자 메시지 끝에 반복하십시오.
LLM 학습 방법: 사전 학습과 RLHF
LLM 학습은 두 가지 뚜렷한 단계로 이루어집니다: 사전 학습(원시 텍스트에서 언어 패턴 학습)과 학습 후 정렬(인간 피드백으로 행동 형성). 이 두 단계는 서로 다른 능력을 만들어 내며, 유사한 벤치마크 점수에도 불구하고 서로 다른 연구소의 모델이 왜 다르게 행동하는지를 설명합니다.
사전 학습 중에 모델은 대규모 코퍼스를 처리합니다 — Llama 3.3은 약 15조 개의 토큰으로 학습되었으며, GPT-4는 약 1–2조 개의 토큰으로 추정됩니다. 목표는 단순합니다: 다음 토큰을 예측하는 것입니다. 명시적인 지식은 저장되지 않으며, 모든 정보는 통계적 패턴으로 모델 가중치에 인코딩됩니다.
학습 후 정렬 — 일반적으로 인간 피드백 강화 학습(RLHF) 또는 그 변형(RLAIF, DPO) — 은 모델을 유용한 어시스턴트로 만들어 줍니다. 인간 평가자가 유용성, 무해성, 정직성을 기준으로 출력을 평가합니다. 그 평가를 바탕으로 보상 모델이 학습되고, 기반 LLM은 보상을 최대화하도록 파인튜닝됩니다. RLHF는 거절 행동, 어조, 안전 가이드라인을 결정하며 — 기본 아키텍처가 아닙니다.
- 사전 학습: 웹 규모 데이터에 대한 비지도 다음 토큰 예측. 언어 패턴, 세계 지식, 추론 단축키를 모델 가중치에 인코딩합니다(최신 모델의 경우 약 70B–405B 파라미터).
- 지도 파인튜닝(SFT): 순수 텍스트 예측기가 아닌 어시스턴트처럼 행동하도록 선별된 지시-응답 쌍으로 모델을 학습합니다.
- RLHF / DPO: 인간의 선호도가 모델을 유용하고 무해하며 정직한 출력으로 이끕니다. DPO(직접 선호도 최적화)는 Llama 및 Mistral 모델이 사용하는 더 계산 효율적인 대안입니다.
- Constitutional AI (Anthropic): Claude는 엣지 케이스에서 인간 피드백에 대한 의존도를 줄이기 위해 원칙 집합("헌법")을 사용하여 추가로 학습됩니다 — Claude Opus 4.8이 이 방식을 사용합니다.
추론 작동 방식: 샘플링과 디코딩
추론 중에 모델은 토큰 단위로 출력을 생성합니다 — 전체 어휘에 대한 확률 분포를 계산하고 사용자가 제어하는 디코딩 매개변수에 따라 샘플링합니다. 가장 중요한 세 가지 매개변수는 온도, top-p(핵 샘플링), 최대 토큰 수입니다.
| 매개변수 | 범위 | 효과 | 최적 용도 |
|---|---|---|---|
| 온도 | 0.0 – 2.0 | 확률 분포를 날카롭게(낮음) 또는 평탄하게(높음) 만듦 | 코드/사실에는 0; 글쓰기에는 0.7; 창의적 과제에는 1.0 |
| Top-p (핵) | 0.0 – 1.0 | 누적 확률이 p에 도달하는 토큰으로 샘플링을 제한 | 대부분의 과제에는 0.9–0.95; 제약된 출력에는 0.5 |
| Top-k | 1 – 어휘 크기 | 다음으로 가장 확률 높은 k개의 토큰으로 샘플링을 제한 | 덜 사용됨; top-p가 일반적으로 선호됨 |
| 최대 토큰 수 | 1 – 컨텍스트 한계 | 출력 길이의 하드 정지 | 잘림을 방지하려면 예상 출력 길이의 2배로 설정 |
| 빈도 패널티 | -2.0 – 2.0 | 이미 생성된 토큰의 반복을 줄임 | 긴 문서에는 0.1–0.3; 코드에는 0 |
컨텍스트 윈도우: 모델이 볼 수 있는 것
컨텍스트 윈도우는 모델이 단일 추론 호출에서 처리할 수 있는 최대 토큰 수입니다 — 시스템 프롬프트, 대화 기록, 문서, 현재 사용자 메시지를 모두 합한 것입니다.** 세션 간에는 아무것도 유지되지 않으며, 모델은 매번 새롭게 시작합니다.
컨텍스트 윈도우 크기는 모델에 따라 크게 다르며, 어떤 사용 사례가 실용적인지에 직접적으로 영향을 미칩니다:
| 모델 | 컨텍스트 윈도우 | 대략적인 단어 수 환산 | 실용적인 문서 한계 |
|---|---|---|---|
| GPT-5.5 (OpenAI) | 128,000 토큰 | 약 96,000단어 | 약 200페이지 PDF |
| Claude Opus 4.8 (Anthropic) | 200,000 토큰 | 약 150,000단어 | 약 300페이지 PDF |
| Gemini 3.1 Pro (Google DeepMind) | 2,000,000 토큰 | 약 1,500,000단어 | 약 3,000페이지 PDF |
| LLaMA 3.1 70B (Meta, Ollama 경유) | 128,000 토큰 | 약 96,000단어 | 약 200페이지 PDF |
프롬프트 엔지니어링에 대한 시사점
LLM 아키텍처를 이해하면 프롬프트 품질이 직접적으로 향상됩니다 — 토큰 위치, 온도, 컨텍스트 윈도우 활용도, 출력 길이는 모두 출력 신뢰성에 측정 가능한 영향을 미칩니다.
- 중요한 지시사항은 처음에 배치하십시오. 시스템 프롬프트는 모든 사용자 메시지보다 먼저 처리됩니다. 긴 프롬프트 중간에 묻혀 있는 지시사항은 "중간 손실" 효과로 인해 가중치가 낮아집니다. 제약 조건과 역할 정의는 시스템 프롬프트에 배치하십시오.
- 온도는 이진 스위치가 아닌 조절 다이얼입니다. 코드 생성과 사실 기반 과제에는 온도 0을 사용하십시오. 콘텐츠 생성에는 0.5–0.7을 사용하십시오. 1.0 초과는 다양성을 높이지만 환각 위험도 크게 증가합니다.
- 토큰 수는 비용과 지연 시간에 선형적으로 영향을 미칩니다. API 가격은 토큰당(입력 및 출력) 책정됩니다. 일일 사용자 100명의 10,000 토큰 시스템 프롬프트는 입력만으로도 하루 100만 토큰의 비용이 발생합니다 — 지시사항을 철저하게 압축하십시오.
- 모델은 자신이 틀렸다는 것을 "알지" 못합니다. 환각은 토큰 예측의 구조적 특성입니다 — 모델은 검증된 정보가 아닌 통계적으로 확률이 높은 것을 출력합니다. 중요한 응용 프로그램에서는 항상 사실 주장을 검증하십시오.
- 컨텍스트 윈도우 ≠ 어텐션 품질. 200,000 토큰 컨텍스트 윈도우가 모델이 모든 200,000 토큰에 동등하게 주의를 기울인다는 의미는 아닙니다. 약 50,000 토큰을 초과하는 문서의 경우 전체 컨텍스트 채우기 대신 RAG를 이용한 청킹을 고려하십시오.
LLM에 대한 일반적인 오해
LLM에 관한 이러한 오해들은 잘못 설계된 프롬프트와 잘못된 기대로 이어지는 경우가 많습니다:
| 오해 | 실제로 일어나는 일 | 프롬프트 엔지니어링에 대한 시사점 |
|---|---|---|
| "모델이 내 문서를 읽고 이해한다" | 모델은 토큰 시퀀스를 처리하고 연속을 예측합니다 — 독해가 이루어지지 않습니다 | 추출하고자 하는 것을 명시적으로 지정하십시오; 모델이 목표를 추론한다고 가정하지 마십시오 |
| "모델이 지난 대화를 기억한다" | 각 API 호출은 무상태입니다; 기록은 컨텍스트 윈도우에 명시적으로 포함해야 합니다 | 관련 이전 컨텍스트를 시스템 프롬프트 또는 대화 기록에 포함시키십시오 |
| "모델이 현재 날짜를 안다" | 모델에는 학습 종료일이 있으며 알려주지 않으면 오늘 날짜를 모릅니다 | 날짜에 민감한 과제의 경우 시스템 프롬프트에 현재 날짜를 주입하십시오 |
| "온도가 높을수록 더 똑똑한 출력이 나온다" | 온도는 능력이나 정확도가 아닌 샘플링 무작위성을 제어합니다 | 분석 과제에는 낮은 온도(0.0–0.3)를 사용하십시오; 창의적 변형에는 높은 온도를 사용하십시오 |
| "모델이 문자 수를 안정적으로 셀 수 있다" | 토큰 경계는 서브워드 단위입니다; 정확한 문자 또는 단어 계산은 기본 기능이 아닙니다 | 정확한 단어 세기를 모델에 의존하지 마십시오; 후처리 또는 코드를 사용하십시오 |
PromptQuorum에서 여러 모델의 온도 효과 테스트
PromptQuorum에서 테스트한 결과 — GPT-5.5, Claude Opus 4.8, Gemini 3.1 Pro에 동일한 창의적 브리프를 온도 0과 온도 0.9에서 각각 전송했을 때, Claude Opus 4.8이 온도 간 출력 편차가 가장 작고 Gemini 3.1 Pro가 가장 크다는 것이 나타났습니다. 온도 0.9에서 Gemini 3.1 Pro는 온도 0 대비 평균 34% 더 긴 출력을 생성했습니다.
PromptQuorum의 멀티 모델 디스패치를 사용하면 지정된 온도에서 모든 사용 가능한 모델에 동시에 프롬프트를 실행하고 출력을 나란히 비교할 수 있습니다 — 모델 기본값에 의존하는 대신 특정 과제에 맞는 온도 설정을 실용적으로 조정할 수 있습니다.
지역별 LLM 아키텍처 차이
LLM의 아키텍처와 성능은 학습 데이터 구성, 토크나이제이션 전략, 규제 제약 등에 따라 지역별로 크게 다릅니다. 이러한 차이를 이해하는 것은 모델을 전 세계적으로 배포하는 팀에게 매우 중요합니다.
Qwen 3은 CJK(중국어, 일본어, 한국어) 스크립트에 대한 뛰어난 토크나이제이션 효율성을 달성합니다** — 만다린 중국어에서 문자당 약 0.3 토큰을 사용하는 반면 GPT-5.5는 문자당 0.5 토큰을 사용합니다. 이 40% 토큰 감소는 아시아 언어 애플리케이션의 API 비용과 지연 시간을 직접적으로 줄여 줍니다. Qwen의 학습 데이터는 20%가 CJK 콘텐츠로 구성되어 있어, 문자 대 의미 밀도가 가장 높은 스크립트에 맞게 토크나이저를 최적화합니다.
Mistral Small과 Mistral Large는 유럽 배포를 위해 명시적으로 설계되었으며, 학습 데이터는 GDPR, 프랑스 AI 법, 데이터 보존 및 모델 투명성에 관한 EU 규정을 준수하도록 필터링되었습니다. 필터링되지 않은 웹 데이터를 주로 학습에 사용하는 모델과 달리, Mistral은 데이터 출처를 문서화하고 EU 시민의 개인 정보를 학습에서 제외시켜, 유럽의 규제 산업(은행, 의료, 법률 기술)에서 기본 선택지가 되었습니다.
DeepSeek의 아키텍처는 학습 구성을 반영합니다: 사전 학습 데이터의 70%가 중국어와 영어, 15%가 코드, 15%가 기타 언어입니다. 이 비율은 중국어 언어 유창성과 코드 생성 속도에 편향된 모델을 만들어 내며, 저자원 언어에서는 성능이 크게 떨어집니다. 토큰 분포와 어텐션 패턴은 영어가 아닌 만다린 중국어의 빈도 패턴에 최적화되어 있습니다.
관련 읽을거리
- 기초: 프롬프트 엔지니어링이란? — LLM 아키텍처 지식을 체계적인 프롬프트 설계에 적용하는 방법
- 기초: 컨텍스트 윈도우 설명 — AI가 잊는 이유 — 컨텍스트 윈도우 한계와 검색 전략에 대한 심층 분석
- 기초: 토큰, 비용, 한계: AI 프롬프팅의 경제학 — 토큰 가격 책정, 요청 한도, GPT-5.5, Claude, Gemini 전반의 비용 최적화
- 기초: AI 환각 설명 — LLM이 정보를 꾸며내는 이유 — 토큰 예측과 사실 검색 부재가 어떻게 신뢰도 오류로 이어지는지
- AI 한계: LLM이 할 수 없는 것들 — 모든 LLM이 공유하는 8가지 구조적 제약과 각각에 대한 엔지니어링 해결책
LLM 작동 방식 이해하는 법
- 1토큰부터 시작하십시오: LLM이 글자나 단어가 아닌 토큰(서브워드 단위)을 보며, 영어에서는 일반적으로 단어당 1–2 토큰임을 이해하십시오. 온라인 토크나이저(OpenAI 또는 Anthropic 제공)를 사용하여 샘플 텍스트의 토큰을 세어 보십시오. "ChatGPT"가 어떻게 "Chat" + "G" + "PT"로 분할되는지, 그리고 이것이 가격 책정과 컨텍스트 윈도우에 어떤 영향을 미치는지 확인하십시오.
- 2트랜스포머 아키텍처의 세 가지 핵심 레이어를 학습하십시오: 임베딩, 어텐션, 출력 프로젝션. 직접 구현할 필요는 없지만 개념적으로 이해하십시오: 임베딩은 토큰을 벡터로 변환하고, 어텐션은 모든 토큰 쌍을 비교하여 관계를 파악하며, 출력 프로젝션은 다시 어휘로 매핑합니다. 이것이 LLM이 맥락을 이해하는 이유와 환각을 일으키는 이유를 설명합니다.
- 3LLM이 환각을 일으키는 이유를 이해하십시오: "올바른 사실"이 아닌 학습 데이터 패턴을 기반으로 "확률적으로 그럴듯한 다음 토큰"을 예측합니다. 학습 데이터에 특정 주제에 대한 상충되거나 부족한 정보가 있으면 모델의 최선의 추측이 틀릴 수도 있습니다. 이는 수정 가능한 버그가 아닌 근본적인 특성입니다. 사실 기반 과제에는 온도(T)를 낮게, 창의적인 과제에는 높게 설정하십시오.
- 4온도와 top-p를 실험하여 출력이 어떻게 변하는지 확인하십시오. T=0.0(결정론적), T=0.7(다양하지만 일관성 있음), T=1.5(무작위)에서 텍스트를 생성하십시오. 더 높은 T = 더 많은 변형임을 확인하십시오. top-p(핵 샘플링)이 확률이 낮은 토큰을 필터링하여 의미 없는 출력을 줄인다는 것을 이해하십시오.
- 5컨텍스트 윈도우를 이해하십시오: 모델은 최근 토큰의 고정된 윈도우만 "봅니다". GPT-5.5의 128k 토큰 윈도우는 약 96,000단어에 해당합니다. 오래된 정보는 윈도우 밖으로 벗어나기 때문에 "잊혀집니다". 이것이 LLM이 긴 대화에서 이전 정보와 모순되는 발언을 하는 이유를 설명합니다.
자주 묻는 질문
LLM은 인간처럼 텍스트를 이해합니까?
아닙니다. LLM은 인간적 의미에서 텍스트를 이해하지 않습니다. 학습 중 학습된 패턴을 기반으로 이전 토큰을 고려하여 통계적으로 가장 확률이 높은 다음 토큰을 예측합니다. 이해, 의도, 의식은 없습니다 — 약 50,000–100,000개 토큰의 어휘에 대한 가중된 확률 분포만 있을 뿐입니다.
LLM에서 토큰이란 무엇입니까?
토큰은 LLM이 처리하는 가장 작은 단위입니다 — 영어에서는 약 단어 0.75개, 중국어나 일본어에서는 약 0.5개에 해당합니다. 단어, 서브워드, 구두점, 공백이 모두 토큰이 됩니다. GPT-5.5는 BPE(Byte Pair Encoding)를 사용하여 처리 전에 텍스트를 토큰으로 분할합니다. 1,000단어 문서는 영어로 약 1,300개의 토큰이 됩니다.
LLM에서 온도는 무엇을 합니까?
온도는 모델이 확률 분포에서 얼마나 무작위로 샘플링하는지를 제어합니다. 온도 0은 항상 가장 높은 확률의 다음 토큰을 선택합니다(결정론적). 온도 1.0은 분포에서 비례적으로 샘플링합니다. 1.5 초과는 분포를 평탄하게 만들고 환각 위험을 높입니다. 대부분의 프로덕션 사용 사례에서는 0.1에서 0.7 사이가 가장 효과적입니다.
프롬프트에서 정보의 위치가 왜 중요합니까?
트랜스포머 어텐션은 컨텍스트 윈도우의 시작과 끝 근처의 토큰에 중간 토큰보다 더 높은 가중치를 부여하는 경향이 있습니다 — Liu et al.(2023)이 문서화한 "중간 손실" 패턴입니다. 약 2,000 토큰을 초과하는 프롬프트의 경우 가장 중요한 지시사항을 처음에 배치하고 핵심 제약 조건을 끝에 반복하십시오.
RLHF란 무엇이며 모델 출력에 어떤 영향을 미칩니까?
인간 피드백 강화 학습(RLHF)은 인간 평가자가 모델 출력을 채점하고 그 채점을 기반으로 보상 모델이 학습되는 학습 후 단계입니다. 기반 LLM은 보상을 최대화하도록 파인튜닝됩니다. RLHF는 거절, 어조, 유용성, 안전 행동을 형성합니다 — 이것이 서로 다른 연구소의 모델이 유사한 벤치마크 점수에도 불구하고 동일한 프롬프트에서 다르게 행동하는 이유입니다.
컨텍스트 윈도우와 메모리의 차이는 무엇입니까?
컨텍스트 윈도우는 단일 추론 호출 중에 모델이 볼 수 있는 모든 텍스트입니다 — 시스템 프롬프트, 기록, 현재 메시지를 포함합니다. 지속적인 메모리가 아닙니다: 대화가 끝나면 모델은 아무것도 유지하지 않습니다. GPT-5.5: 128,000 토큰. Claude Opus 4.8: 200,000 토큰. Gemini 3.1 Pro: 2,000,000 토큰.
"중간 손실" 효과란 무엇이며 어떻게 피할 수 있습니까?
Stanford University의 Liu et al.(2023)이 문서화한 "중간 손실" 효과는 트랜스포머 어텐션이 긴 컨텍스트 중간의 정보를 체계적으로 과소 평가한다는 것을 보여 줍니다. 이를 피하려면: 중요한 지시사항을 시스템 프롬프트(처음)에 배치하고, 입력의 처음 10–15%에 중요한 컨텍스트를 유지하며, 사용자 메시지 끝에 가장 중요한 제약 조건을 반복하십시오. 약 50,000 토큰을 초과하는 문서에는 전체 컨텍스트 채우기 대신 RAG를 사용하십시오.
RLHF와 Constitutional AI의 차이는 무엇입니까?
RLHF(인간 피드백 강화 학습)는 인간 평가자가 출력을 채점하고, 보상 모델을 학습하며, LLM을 파인튜닝하여 보상을 최대화하는 학습 후 기법입니다. Constitutional AI(Anthropic이 Claude에 사용)는 모든 엣지 케이스에 대한 인간 피드백 없이 행동을 안내하는 서면 원칙 집합("헌법")을 추가함으로써 RLHF를 확장합니다. 이는 일관된 가치 정렬을 유지하면서 인간 평가자에 대한 의존도를 줄여 줍니다.
GPT-5.5, Claude, Gemini의 아키텍처적 차이는 무엇입니까?
세 모델 모두 트랜스포머 기반 LLM이지만 규모와 학습 후 처리에서 차이가 있습니다. GPT-5.5(OpenAI): 128,000 토큰 컨텍스트, 추론에 뛰어남. Claude Opus 4.8(Anthropic): 200,000 토큰, 정렬을 위해 Constitutional AI 사용. Gemini 3.1 Pro(Google DeepMind): 초장문 문서 처리를 위한 2,000,000 토큰. 이러한 차이는 비용, 지연 시간, 다양한 과제에 대한 적합성에 영향을 미칩니다.
1,000단어 텍스트의 토큰 수는 몇 개입니까?
영어에서 1,000단어 ≈ 1,300–1,350 토큰입니다. 대략 1 토큰 = 0.75단어입니다. 중국어나 일본어의 경우 1 토큰 ≈ 0.5단어를 사용하십시오 — 중국어/일본어 1,000단어 ≈ 2,000 토큰입니다. 토큰 수는 API 비용과 컨텍스트 윈도우 소비에 직접적으로 영향을 미칩니다.
온도와 top-p의 차이는 무엇입니까?
온도는 전체 확률 분포를 날카롭게 하거나 평탄하게 합니다 — 온도 0 = 결정론적, 온도 1.0 = 표준, 온도 2.0 = 매우 무작위적. Top-p(핵 샘플링)는 샘플링을 누적 확률이 p에 도달하는 가장 작은 토큰 집합으로 제한합니다 — top-p 0.9는 "확률 질량의 90%를 구성하는 토큰에서 샘플링"을 의미합니다. 대부분의 과제에서는 온도가 아닌 top-p(0.8–0.95)를 조정하십시오; 온도는 창의성 제어를 위해 가장 효과적입니다.
출처 및 추가 읽을거리
- Vaswani et al., 2017. "Attention Is All You Need" — 모든 현대 LLM의 기반이 되는 셀프 어텐션 메커니즘을 소개한 원본 트랜스포머 논문
- Liu et al., 2023. "Lost in the Middle: How Language Models Use Long Contexts" — 장문 컨텍스트 LLM에서 위치 의존적 어텐션 편향을 문서화한 Stanford 연구
- Ouyang et al., 2022. "Training language models to follow instructions with human feedback" — GPT-3에 RLHF를 도입한 InstructGPT 논문, ChatGPT 및 현대 정렬된 LLM의 기반
- OpenAI. 토크나이저 문서 — 토큰 계산 및 GPT 모델용 텍스트 인코딩 방법에 대한 대화형 가이드
- Touvron et al., 2023. "Llama 3.3: Open Foundation and Fine-Tuned Chat Models" — Llama 3.3 아키텍처, 학습 파이프라인, 지시 튜닝 방법론에 관한 Meta의 포괄적인 논문
- Anthropic. Constitutional AI: Harmlessness from AI Feedback — 순수 RLHF의 대안으로 모델 행동을 안내하기 위해 "헌법"을 사용하는 것에 관한 Anthropic 연구
- HuggingFace. Tokenizers Library & Summary — 현대 LLM에서 사용되는 BPE, WordPiece, SentencePiece 및 기타 토크나이제이션 알고리즘에 대한 기술적 심층 분석
- Google DeepMind. Gemini 3.5 Technical Report — 100만 토큰 컨텍스트 윈도우를 가진 최신 모델의 아키텍처 및 성능 분석
- EleutherAI. GPT-NeoX-20B: An Open-Source Autoregressive Language Model — 오픈 소스 모델 학습 문서화 및 대규모 LLM 개발의 아키텍처 선택 분석
- OpenAI. Improving Language Models by Segmenting, Attending, and Predicting with Structured State Space Models — 효율적인 장문 컨텍스트 처리를 위한 순수 트랜스포머 어텐션의 대안에 관한 연구
