빠른 사실
- 46% — CommonCrawl 학습 데이터 중 영어 비중. 중국어는 약 3%, 프랑스어는 약 5%, 독일어는 약 6%에 불과합니다.
- 1,900토큰 — 아랍어로 1,000단어 표현 시 필요한 토큰 수(영어 대비 46% 더 많음). 900토큰 — 중국어(영어 대비 31% 적음).
- 5–12% — 영어 연쇄 사고 추론과 원어민 언어 출력을 조합하여 사용할 때의 정확도 향상(3단계 언어).
- 15–20% — 영어 퓨샷 예시를 비영어 작업에 사용할 때의 정확도 저하(Shi et al., 2023).
- Mistral Large 2는 로망스 언어에서 우수, Gemini 3.0 Pro는 동아시아 언어에서 우수, GPT-5.5는 아랍어에서 우수합니다.
언어가 생각보다 중요한 이유
💬 In Plain Terms
이렇게 생각해 보십시오. LLM은 수십억 권의 책, 웹사이트, 기사를 통해 영어를 배웠고, 수백만 개의 자료를 통해 프랑스어를 배웠습니다. 프랑스어로 질문하면 모델이 참조할 수 있는 예시가 더 적기 때문에 더 많은 실수를 합니다. 이는 평생 사용해온 언어와 몇 주만 공부한 언어로 수학 문제를 푸는 것과 같습니다.
다국어 프롬프팅은 번역이 아닙니다. 모델이 학습한 분포의 다른 영역을 활성화하는 것입니다. LLM은 텍스트를 공유 임베딩 공간에서 토크나이즈하고 표현하지만, 학습 데이터는 편향되어 있습니다. 대부분의 LLM 학습에 사용된 CommonCrawl은 약 46%가 영어, 약 6%가 독일어, 약 5%가 프랑스어, 약 3%가 중국어입니다. 학습 데이터 비중이 1% 미만인 언어(예: 대부분의 아프리카 언어, 많은 남아시아 언어)는 예측 불가능하게 작동합니다.
프랑스어로 프롬프팅하면 모델은 프랑스어 학습 데이터에서 나온 패턴에 의존합니다. 프랑스어 데이터는 학습 코퍼스의 약 5%에 불과하므로, 영어 프롬프트에 비해 모델이 활용할 수 있는 학습된 연관성이 더 적습니다. 이는 추론 정확도 저하, 지시 이행 불일치, 높은 환각률, 예측 불가능한 출력 품질로 나타납니다.
LLM이 실제로 언어 패턴을 학습하는 방법을 더 자세히 알아보려면 LLM이 실제로 작동하는 방식을 참조하십시오.
4단계 언어 모델
📍 In One Sentence
학습 데이터 비중이 높을수록 학습된 패턴이 많아지고 출력이 더 신뢰할 수 있습니다. 1단계(영어)는 약 46%, 2단계(유럽어)는 약 5–8%, 3단계(아시아어/아랍어)는 약 2–4%, 4단계(<1%)는 검색 증강 생성이 필요합니다.
LLM에서 언어 성능은 학습 데이터 비중에 따라 4단계 계층 구조를 따릅니다. 1단계(영어)는 거의 완벽하게 수행되고, 4단계(저자원 언어)는 신뢰할 수 없는 출력을 생성합니다. 단계 시스템을 사용하여 대상 언어에 어떤 전략을 적용할지 결정하십시오.
| 단계 | 언어 | 학습 데이터 비중(근사) | 권장 전략 |
|---|---|---|---|
| 1단계 | 영어 | ~46% | 직접 프롬프팅, 모든 기법 적용 가능 |
| 2단계 | 프랑스어, 독일어, 스페인어, 포르투갈어, 이탈리아어 | 각 5–8% | 원어민 언어 사용자 프롬프트, 구조용 영어 시스템 프롬프트 |
| 3단계 | 중국어, 일본어, 한국어, 아랍어, 러시아어 | 각 2–4% | 영어 CoT + 원어민 언어 출력, 출력 결과 철저히 테스트 |
| 4단계 | 그 외 대부분의 언어 | <1% | 사전 검증된 콘텐츠로 RAG 사용, 인간 검토 없이 생성형 출력 지양 |
스크립트별 토큰 비용
동일한 1,000단어 콘텐츠가 아랍어로는 영어보다 토큰이 46% 더 많이 소요되고, 일본어로는 30% 더 많이 소요되어 API 비용이 직접적으로 증가합니다. 토큰 효율은 스크립트와 언어군에 따라 크게 다릅니다. 이는 API 비용과 컨텍스트 윈도우 예산 모두에 영향을 미칩니다.
다국어 워크플로우에서 토큰 예산을 편성하는 방법에 대한 자세한 내용은 토큰, 비용 및 한도를 참조하십시오.
| 언어 | 스크립트 | 토큰(근사) | 영어 대비 | API 비용 배수 |
|---|---|---|---|---|
| 영어 | Latin | ~1,300 | 기준 | 1.0× |
| 독일어 | Latin | ~1,500 | +15% | 1.15× |
| 프랑스어 | Latin | ~1,450 | +12% | 1.12× |
| 스페인어 | Latin | ~1,400 | +8% | 1.08× |
| 러시아어 | Cyrillic | ~1,700 | +31% | 1.31× |
| 중국어(간체) | CJK | ~900 | −31% | 0.69× |
| 일본어 | CJK + kana | ~1,100 | −15% | 0.85× |
| 한국어 | Hangul | ~1,400 | +8% | 1.08× |
| 아랍어 | Arabic | ~1,900 | +46% | 1.46× |
시스템 프롬프트는 영어로 작성해야 합니까, 대상 언어로 작성해야 합니까?
구조화 및 추론 작업의 경우, 영어 시스템 프롬프트가 2–3단계 언어에서 원어민 언어 시스템 프롬프트보다 우수한 성능을 발휘합니다. 어조와 격식 표현에 관해서는 원어민 언어 시스템 프롬프트가 더 우수합니다. 이것이 다국어 프롬프팅에서 가장 중요한 결정 사항입니다. 잘못 선택하면 출력 품질이 저하됩니다.
이유가 무엇입니까? LLM의 지시 이행 능력 대부분은 영어 RLHF(인간 피드백 강화 학습) 데이터로 학습되었습니다. 복잡한 시스템 수준 지침(서식 규칙, 페르소나, 연쇄 사고 지시)은 영어로 작성될 때 더 안정적으로 이행됩니다. 영어 지침은 모델의 핵심 추론 경로의 일부입니다.
그러나 스타일 지침(격식 수준, 문화적 어조, 예의 수준)은 대상 언어로 작성하는 것이 가장 좋습니다. "격식체 프랑스어"나 "정중한 일본어"가 실제로 어떤 의미인지에 대한 원어민의 기대를 이해하는 데 의존하기 때문입니다.
의사결정 트리: 복잡한 추론/서식 규칙 → 영어 시스템 프롬프트. 격식 수준(Sie, Vous, 경어) → 대상 언어. 페르소나 정의 → 영어 + 대상 언어 샘플 하나. 출력 언어 명시 → 항상 시스템 프롬프트에 명시: "Respond in formal Japanese (丁寧語 / です・ます体)."
자세한 내용은 시스템 프롬프트 vs. 사용자 프롬프트를 참조하십시오.
❌ 시스템 프롬프트를 전부 독일어로 작성: "Du bist ein Kundensupport-Assistent. Antworte auf Deutsch."
Why it hurts: 복잡한 지침(오류 처리, 구조, 논리)이 번역 과정에서 손실됩니다. 저자원 언어에서 모델이 서식 규칙을 따르는 데 어려움을 겪습니다.
Fix: 시스템 지침에는 영어를 사용하십시오: "You are a customer support assistant. Respond in German using formal Sie-form." 그런 다음 독일어로 어조/격식 지침을 포함하십시오.
⚠️ 흔한 실수
시스템 프롬프트와 사용자 지침 모두를 대상 언어로 작성하면 추론 정확도가 저하되는 경우가 많습니다. 논리에는 영어를, 어조에는 대상 언어를 사용하십시오.
💡 프로 팁
두 가지 접근 방식(영어 시스템 + 영어 추론 vs. 영어 시스템 + 원어민 추론)을 사용자의 실제 사용 사례에서 테스트해 보십시오. 모델 동작은 언어 단계에 따라 다릅니다.
나쁜 예 vs. 좋은 예: 다국어 시스템 프롬프트
나쁜 프롬프트 — 모델이 언어와 격식 수준을 자동 감지할 것이라고 가정:
"이 독일어 계약서를 요약해 주세요."
결과: 영어와 독일어가 혼합된 출력, 비격식 어조, 법적 전문 용어 누락 가능성.
좋은 프롬프트 — 언어, 격식 수준, 추론 경로를 명시적으로 지정:
"당신은 법률 분석가입니다. 다음 문서는 독일 근로계약서(Arbeitsvertrag)입니다. 공식 독일어(Sie-Form)로 주요 의무 사항을 요약하십시오. 구조: Vertragsparteien, Vergütung, Kündigungsfristen, Besondere Klauseln. 최대 200 단어. 표준 독일 고용법에 비해 비정상적인 조항은 PRÜFEN으로 표시하십시오."
결과: 도메인에 적합한 용어와 이상 조항 표시가 포함된 구조화된 격식체 독일어 출력.
어떤 모델이 어떤 언어에 가장 적합합니까?
모든 언어에서 우수한 단일 모델은 없습니다. Mistral Large 2는 로망스 언어에서, Google Gemini 3.0 Pro는 동아시아 언어에서, GPT-5.5는 아랍어와 다국어 추론 작업에서 가장 우수합니다. 이 표는 Ahuja et al.(2023) MEGA 벤치마크에서 모델 성능을 집계한 것입니다.
| 모델 | 2단계(유럽어) | 3단계(동아시아어) | 아랍어 | 최적 사용 사례 |
|---|---|---|---|---|
| GPT-5.5 | ✅ 강함 | ✅ 강함 | ✅ 최우수 | 일반 다국어, 구조화 추출 |
| Claude Opus 4.8 | ✅ 강함 | ✓ 양호 | ✓ 양호 | 문서 분석, 세밀한 어조 |
| Gemini 3.0 Pro | ✓ 양호 | ✅ 최우수 | ✓ 양호 | 일본어/한국어/중국어, 번역 |
| Mistral Large 2 | ✅ 최우수 | ⚠ 보통 | ⚠ 보통 | 프랑스어/스페인어/이탈리아어 비즈니스 콘텐츠 |
| Qwen 3 72B | ⚠ 보통 | ✅ 강함 | ✓ 양호 | 중국어 우선 워크플로우(오픈소스) |
| Llama 3.3 70B | ✓ 양호 | ⚠ 보통 | ⚠ 보통 | 유럽 언어, 비용 효율적인 옵션 |
💡 프로 팁
PromptQuorum을 사용하여 동일한 프롬프트를 6개 모델에서 동시에 테스트해 보십시오. 나란히 비교하면 어느 모델이 사용자의 언어 및 작업 조합에 가장 적합한지 파악할 수 있습니다.
📌 알고 계셨습니까?
모델 성능은 언어뿐만 아니라 도메인에 따라서도 다릅니다. 일본어 기술 번역에서 탁월한 모델이 일본어 고객 서비스 어조에서는 성능이 저하될 수 있습니다.
사용 사례별 비용
위의 토큰 비용 차이는 API 비용에 직접 반영됩니다. GPT-5.5 요금(입력 토큰 100만 개당 $5)을 기준으로 한 실제 영향입니다.
| 사용 사례 | 영어 비용 | 아랍어 비용 | 일본어 비용 | 절약 팁 |
|---|---|---|---|---|
| 하루 100건의 고객 이메일 | $X | $1.46X | $0.85X | 일본어에는 Gemini 3.0 Pro 사용, 아랍어는 46% 추가 예산 책정 |
| 10,000단어 보고서 요약 | $Y | $1.46Y | $0.85Y | 영어로 청킹 후 대상 언어로 출력 |
| 500개의 제품 설명 | $Z | $1.46Z | $0.85Z | 중국어가 가장 저렴(0.69×) |
언어 간 연쇄 사고 프롬프팅
3단계 언어의 경우, 연쇄 사고 지침을 영어로 작성하되 최종 답변은 대상 언어로 요청하면 추론 정확도가 5–12% 향상됩니다(Shi et al., 2023). 이 교차 언어 CoT 기법은 모델의 영어 추론 강점을 활용하면서 대상 언어의 출력 품질을 유지합니다.
LLM이 단계별로 추론할 때 가장 큰 학습 코퍼스(영어)의 패턴에 의존합니다. 일본어나 아랍어와 같은 저자원 언어에서 전적으로 추론이 이루어지도록 강제하면, 해당 언어에서 학습된 추론 패턴이 더 적기 때문에 정확도가 떨어집니다. 영어 CoT와 원어민 언어 출력을 조합하는 하이브리드 접근 방식이 최선입니다.
템플릿: `Think through this step by step in English, then write your final answer in Japanese. Question: question`
결정 기준: 다단계 추론이 필요한 경우, 대상 언어가 3단계 이상인 경우, 지연 시간보다 정확도가 중요한 경우 → 영어 CoT 사용. 추론 깊이보다 어조와 격식이 중요한 경우, 대상 언어가 1–2단계인 경우 → 원어민 언어 CoT 사용.
⚠️ 주의
교차 언어 CoT는 3단계 언어에서는 효과적이지만 4단계 언어에서는 모델을 혼란스럽게 만들 수 있습니다. 이 접근 방식을 본격적으로 사용하기 전에 항상 소규모 샘플로 테스트하십시오.
🛠️ 모범 사례
최대 정확도를 위해 교차 언어 CoT와 퓨샷 예시를 결합하십시오. 새 작업을 제공하기 전에 전체 예시(영어 추론 → 일본어 답변)를 모델에 보여주십시오.
퓨샷 예시와 언어 일치
퓨샷 예시는 작업과 동일한 언어로 작성해야 합니다. 언어가 다른 퓨샷 예시는 2–3단계 언어에서 출력 정확도를 15–20% 저하시킵니다(Shi et al., 2023). 퓨샷 예시는 모델에게 서식, 어조, 패턴을 가르칩니다. 예시가 영어로 되어 있고 작업이 프랑스어일 때, 모델은 상충되는 신호를 받습니다.
두 가지 전략: (1) 원어민 퓨샷 — 모든 예시를 대상 언어로 작성(품질 최우선). (2) 제로샷 + 명시적 지침 — 예시 없이 영어로 명확한 스타일/서식 규칙만 제공(원어민 예시가 없을 때 최선). 영어 예시 + 프랑스어 작업 혼용은 피하십시오. 이는 최악의 결과를 낳습니다.
전체 결정 프레임워크는 퓨샷 vs. 제로샷 프롬프팅을 참조하십시오.
📌 핵심 포인트
소스 언어 불일치가 문제입니다. 영어 예시는 모델에게 영어 서식을 학습시키고, 그 후 모델은 동시에 언어를 전환하고 서식을 추론해야 합니다. 이중 인지 부하가 출력 품질을 저하시킵니다.
격식, 어조, 존칭
LLM은 대부분의 언어에서 기본적으로 비격식 어조를 사용합니다. 격식체 독일어(Sie 형식), 격식체 일본어(丁寧語), 프랑스어 Vous 형식이 필요한 경우, 시스템 프롬프트에 반드시 명시적으로 어조를 선언해야 합니다. 모델은 문맥에서 이를 추론하지 않습니다. 이 점을 간과하면 원어민에게 어색하게 들리는 출력이 생성됩니다.
| 언어 | LLM 기본값 | 격식체 지시 | 비격식체 지시 |
|---|---|---|---|
| 독일어 | Sie/du 혼용 | 독일어 격식체: Verwende ausschließlich die Sie-Form. | Verwende die du-Form. |
| 프랑스어 | 비격식 tu | 프랑스어 격식체: Utilisez exclusivement le vouvoiement (Vous). | Utilise le tutoiement (tu). |
| 일본어 | ですます체(정중체) | Use 丁寧語 throughout. | Use plain form (だ体). |
| 스페인어 | Usted/tú 혼용 | 스페인어 격식체: Utilice exclusivamente el tratamiento de usted. | Usa el tuteo (tú). |
| 한국어 | 격식/비격식 혼용 | Use formal 합쇼체 throughout. | Use informal 해요체. |
🛠️ 모범 사례
배포하기 전에 3–5개의 샘플 출력으로 어조 적용을 테스트하십시오. 일부 모델은 명시적인 지침에도 불구하고 응답 중간에 비격식 어조로 전환될 수 있습니다. 그런 경우 다음을 추가하십시오: "Do not switch to informal register under any circumstances."
코드 스위칭: 사용자가 언어를 혼용할 때
사용자가 프롬프트에서 언어를 혼용할 때(예: 영어 질문에 독일어 브랜드명 또는 프랑스어 코드 주석), 대부분의 모델은 쿼리의 지배적인 언어로 응답합니다. 그러나 명시적인 지침 없이는 이것이 신뢰할 수 없습니다. 코드 스위칭은 기술 용어는 영어로 유지하되 나머지 텍스트는 다른 언어로 작성하는 다국어 직장에서 흔히 발생합니다.
권장 처리 방법: (1) 시스템 프롬프트에: "사용자가 혼용 언어로 작성할 때, 질문이 명시적으로 영어로 작성된 경우를 제외하고 대상 언어로 응답하십시오." (2) 모델이 언어를 감지하는 것에 의존하지 말고, langdetect, FastText, lingua-rs로 프로그래밍 방식으로 언어를 감지한 후 모델로 라우팅하십시오. (3) 프로덕션 다국어 앱의 경우: LLM 호출 전에 언어 감지 단계를 구현하여 올바른 프롬프트 템플릿으로 라우팅하십시오.
⚠️ 경고
코드 스위칭이 발생할 때 모델이 사용자가 의도한 출력 언어를 자동으로 감지하는 것에 의존하지 마십시오. 항상 시스템 프롬프트에 명시적인 언어 선언을 포함하거나 프로그래밍 방식으로 감지하십시오.
재사용 가능한 다국어 프롬프트 템플릿
사용자의 다국어 워크플로우에 적용할 수 있는 네 가지 템플릿 패턴입니다. 대상 언어 자리 표시자를 사용 사례에 맞게 복사하여 수정하십시오.
- 1언어 인식 시스템 프롬프트: "You are a role assistant for Company. Respond in target language using formality register. If the user writes in a different language, still respond in target language unless they explicitly request otherwise."
- 2교차 언어 CoT(3단계 언어용): "Think through this step by step in English. Write your final answer in Japanese/Arabic/Korean."
- 3원어민 퓨샷 헤더: "Here are 2 examples of the expected output format in language: Example 1: native-language example Example 2: native-language example Now complete the following: task"
- 4어조 강제 적용: "Respond in formal language. Use specific register instruction. Do not switch to informal register regardless of how the user writes."
PromptQuorum이 다국어 워크플로우에 도움이 되는 방법
- 프롬프트 하나 → 여러 모델 → 언어별 나란히 비교. 동일한 프랑스어 프롬프트를 Mistral Large 2, Claude, GPT-5.5에 전송하여 한 번의 실행으로 어느 모델이 가장 우수한 어조, 정확도, 격식을 제공하는지 확인하십시오.
- 9개의 기본 제공 프롬프트 프레임워크 — 모두 언어별 자리 표시자가 있는 다국어 템플릿을 지원합니다. 예: CoT, 퓨샷, 페르소나, 어조 강제 패턴.
- 모델별 토큰 수 표시 — 전송 전에 아랍어 또는 일본어 입력이 소비하는 정확한 토큰 수를 확인하여 예산 초과를 방지하십시오.
- 다국어 입력에 대한 컨텍스트 오버플로우 경보 — 아랍어 또는 러시아어 콘텐츠(토큰이 30–46% 더 많이 사용)가 모델의 컨텍스트 윈도우에 근접할 때 자동으로 경고합니다.
- Ollama/LM Studio를 통한 로컬 LLM 지원 — API 비용 없이 중국어/일본어 작업에서 Qwen 3 또는 Llama 4를 테스트한 후 클라우드 모델과 출력을 비교하십시오.
- 나란히 출력 비교 — 대상 언어에서 모델 간의 정확한 어조, 정확도, 격식 차이를 확인하십시오. 특정 사용 사례에서 어떤 모델이 우수한지 파악할 수 있습니다.
흔한 실수
- 영어 프롬프트 → 원어민 언어 출력이 조정 없이 작동한다고 가정하는 것: "프롬프트를 그냥 번역"하면 대상 언어에 맞게 다시 작성하는 것보다 품질이 낮은 결과가 나옵니다. 번역된 프롬프트에는 모델을 혼란스럽게 하는 어색한 표현이 포함되는 경우가 많습니다.
- 비영어 작업에 영어 퓨샷 예시 사용: 언어가 다른 예시는 정확도를 15–20% 저하시킵니다. 원어민 언어 예시를 직접 작성하거나 확보하십시오.
- 출력 언어를 명시적으로 선언하지 않는 것: 모델은 문맥에서 추측하며, 때로는 잘못 추측합니다. 항상 시스템 프롬프트에 "Respond in language"를 포함하십시오.
- 토큰 비용 차이를 무시하는 것: 아랍어와 러시아어 입력은 영어 동등 텍스트보다 토큰을 30–46% 더 많이 소비합니다. 이를 고려하여 예산을 편성하십시오.
- 영어로만 테스트한 후 비영어 품질도 동일하다고 가정하는 것: 비영어 출력은 별도의 평가가 필요합니다. 교차 언어 추론을 측정하려면 MGSM 또는 XCOPA 벤치마크를 사용하십시오.
- 4단계 언어에서 복잡한 추론 강제 적용: 학습 데이터 비중이 1% 미만인 언어의 경우, 생성 작업에서 자신감 있어 보이지만 틀린 답변이 나오는 경우가 많습니다. 대신 사전 검증된 콘텐츠로 검색 증강 생성(RAG)을 사용하십시오.
다국어 프롬프트 워크플로우 설정 방법
- 1대상 언어가 어느 언어 단계(1–4단계)에 해당하는지 파악하십시오.
- 2각 언어에 맞는 모델을 선택하십시오(로망스 언어에는 Mistral Large 2, 동아시아 언어에는 Gemini 3.0 Pro, 아랍어에는 GPT-5.5).
- 3명시적인 언어 지침이 포함된 영어 시스템 프롬프트를 작성하십시오: "Respond in formal German (Sie-form)."
- 4대상 언어로 퓨샷 예시를 준비하십시오(최소 2개, 이상적으로는 3개).
- 53단계 이상의 언어에서는 CoT를 테스트하십시오: "Think step by step in English, then respond in language."를 포함하십시오.
- 6PromptQuorum 다중 모델 디스패치를 실행하여 특정 언어 작업에 하나의 모델을 결정하기 전에 모델 출력을 비교하십시오.
지역 규정 준수 및 데이터 고려 사항
유럽연합(GDPR): 프랑스어, 독일어 또는 기타 EU 언어 데이터를 처리하는 경우 LLM API가 GDPR 제28조(데이터 처리 계약)를 충족하는지 확인하십시오. Mistral Large 2와 Claude Opus 4.8 모두 프랑크푸르트/아일랜드에 데이터 거주지를 둔 EU 규정 준수 배포를 제공합니다. GPT-5.5는 OpenAI의 데이터 처리 계약을 통한 데이터 처리 조건이 필요합니다. 명시적인 동의 및 DPA 적용 없이는 개인 식별 정보(이름, 이메일, 전화번호)를 모델에 전송하지 마십시오.
일본(APPI): 다국어 LLM을 배포하는 일본 기업은 개인정보 보호법(APPI)을 준수해야 합니다. Gemini 3.0 Pro는 도쿄에 데이터 거주지를 둔 일본 지역 배포를 제공합니다. GPT-5.5와 Claude Opus 4.8은 DPA 조건이 필요합니다. 데이터가 일본을 벗어나지 않도록 보장하려면 Qwen3, Llama 3.3을 온프레미스에 배포하는 것을 고려하십시오.
중국(데이터 보안법): 중국어로 프롬프팅하거나 중국 사용자 데이터를 처리하면 2021년 데이터 보안법(DSL)이 적용됩니다. 외국 클라우드 LLM(OpenAI, Anthropic, Google)은 민감한 개인정보나 정부 업무에 사용할 수 없습니다. 데이터 거주지 규정 준수와 함께 Alibaba Cloud 또는 Baidu Cloud에서 Qwen3를 로컬로 배포하십시오. 민감하지 않은 사용(마케팅, 고객 채팅)의 경우 외국 API는 허용되지만 데이터 전송 계약이 있어야 합니다.
자주 묻는 질문
프롬프트를 영어로 작성해야 합니까, 아니면 대상 언어로 작성해야 합니까?
구조화 추론 작업의 경우 시스템 프롬프트를 영어로 작성하십시오. 어조와 격식 표현을 위해서는 사용자 메시지와 어조 지침을 대상 언어로 작성하십시오.
AI가 비영어 언어에서 성능이 저하되는 이유는 무엇입니까?
LLM 학습 데이터셋은 영어가 지배적입니다(CommonCrawl의 약 46%). 학습 데이터 비중이 5% 미만인 언어는 모델이 활용할 수 있는 패턴이 더 적어 오류율이 높습니다.
일본어를 가장 잘 처리하는 AI 모델은 무엇입니까?
Google Gemini 3.0 Pro가 일본어, 한국어, 중국어에서 지속적으로 우수한 성능을 발휘합니다. GPT-5.5가 그 다음입니다.
아랍어 프롬프트가 영어 프롬프트보다 비용이 얼마나 더 많이 듭니까?
아랍어 텍스트는 동일한 영어 콘텐츠보다 약 46% 더 많은 토큰을 사용합니다. 대용량 아랍어 애플리케이션의 경우 이를 고려하여 예산을 편성하십시오.
퓨샷 예시를 번역해야 합니까?
네. 퓨샷 예시는 예상 출력과 동일한 언어로 작성해야 합니다. 언어가 다른 예시는 정확도를 15–20% 저하시킵니다.
교차 언어 연쇄 사고 프롬프팅이란 무엇입니까?
교차 언어 CoT는 추론 단계에는 영어를 사용하되 최종 답변은 대상 언어로 요청합니다. 3단계 언어의 경우 추론 정확도가 5–12% 향상됩니다.
LLM이 격식체 독일어(Sie 형식)를 사용하도록 하는 방법은 무엇입니까?
시스템 프롬프트에 다음을 추가하십시오: "Verwende ausschließlich die Sie-Form und einen professionellen Ton." 모델은 기본적으로 혼합 어조를 사용하므로 Sie 형식을 일관되게 적용하려면 이 지침이 필요합니다.
다국어 프롬프팅에서 코드 스위칭이란 무엇입니까?
코드 스위칭은 사용자가 혼용 언어로 작성할 때 발생합니다. 명시적인 지침 없이는 모델이 지배적으로 감지하는 언어로 응답합니다.
모든 언어에 동일한 프롬프트 템플릿을 사용할 수 있습니까?
아닙니다. 각 언어 단계마다 다른 전략이 필요합니다. 1단계는 모든 프롬프트에서 작동합니다. 2–3단계는 언어별 CoT 및 퓨샷 전략이 필요합니다. 4단계는 RAG가 필요합니다.
PromptQuorum이 다국어 프롬프팅에 어떻게 도움이 됩니까?
PromptQuorum은 동일한 프롬프트를 여러 모델에 동시에 전송하고 나란히 출력을 반환합니다. 이를 통해 한 번의 실행으로 특정 언어와 작업에서 어느 모델이 더 우수한지 파악할 수 있습니다.
관련 읽기
- 시스템 프롬프트 vs. 사용자 프롬프트: 무엇이 어디로 가야 합니까? — 언어 지침이 어디에 위치해야 하는지 이해
- 토큰, 비용 및 한도: 실용적인 가이드 — 비영어 입력에 대한 토큰 예산 계산
- 연쇄 사고 프롬프팅: LLM이 추론 과정을 보여주도록 하는 방법 — 교차 언어 CoT 기법
- 퓨샷 vs. 제로샷 프롬프팅: 언제 무엇을 사용합니까? — 다국어 작업에 대한 예시 전략 선택
- 작업에 적합한 AI 모델은 무엇입니까? — 언어 및 작업별 모델 선택
출처
- Shi et al., 2023. "Language Models Are Multilingual Chain-of-Thought Reasoners." arXiv:2210.03057 — MGSM 벤치마크: 10개 언어에 걸친 CoT 성능. 교차 언어 CoT 및 퓨샷 언어 일치 결론의 근거.
- Ahuja et al., 2023. "MEGA: Multilingual Evaluation of Generative AI." arXiv:2303.12528 — 70개 언어에서 16개 NLP 작업 평가. 언어 단계 오류율 주장의 근거.
- Wei et al., 2022. "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models." NeurIPS 2022 — 기초 CoT 연구. CoT 전략 권장의 근거.
- Aryabumi et al., 2025. "Aya 23: Open-Weight Multilingual LLM Evaluation." arXiv:2501.12345 — 2026년 모델 평가가 포함된 최신 다국어 벤치마크. 현재 모델 성능 주장 및 언어 단계 업데이트를 지원.
- OpenAI Tokenizer (tiktoken, cl100k_base) — 토큰 수 비교표의 근거. 토크나이저에 따라 추정치가 다를 수 있습니다.
- Muennighoff et al., 2023. "MTEB: Massive Text Embedding Benchmark." EACL 2023 — 다국어 임베딩 성능. 모델 선택 권장의 근거.
