Skip to main content
PromptQuorumPromptQuorum
Home/Local LLMs/ALLaM, AceGPT 및 최고의 사우디 아랍어 로컬 LLM (2026)
Best Models

ALLaM, AceGPT 및 최고의 사우디 아랍어 로컬 LLM (2026)

·11분 읽기·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

사우디아라비아의 아랍어 로컬 AI를 위해서는 ALLaM 7B (HUMAIN/NCAI, Apache 2.0)가 공개적으로 이용 가능한 선도적 모델입니다 — AraLingBench에서 72–74%를 기록하며 Qwen 변형의 40–62%를 능가하고 — GGUF 가중치를 사용해 Ollama를 통해 로컬에서 실행됩니다. AceGPT 7B/13B (KAUST + CUHKSZ)는 대안이지만 2023년 12월 이후로 유지 관리되지 않는 것으로 보입니다.

HUMAIN의 ALLaM 모델과 공식적인 2026년 인공지능의 해를 포함한 사우디아라비아의 AI 우선 야망은 새로운 세대의 아랍어 네이티브 로컬 LLM을 만들어내고 있습니다. 그러나 아랍어 작업용 모델을 선택하는 것은 단순히 파라미터 수의 문제가 아닙니다. 글로벌 공급업체의 다국어 모델은 문법적으로 유창하더라도 문화 및 방언 작업에서 아랍어 특화 모델보다 훨씬 낮은 점수를 받습니다. 이 가이드는 ALLaM (HUMAIN/NCAI), AceGPT (KAUST + CUHKSZ), 그리고 최고의 다국어 대안을 검증된 벤치마크 데이터, VRAM 요구 사항, 그리고 Ollama로 ALLaM을 로컬에서 실행하는 단계별 가이드와 함께 다룹니다.

ALLaM, AceGPT 및 최고의 사우디 아랍어 로컬 LLM (2026)

Key Takeaways

  • ALLaM 7B는 공개적으로 자체 호스팅 가능한 최고의 아랍어 모델입니다 — NCAI/SDAIA가 구축했고 (현재 HUMAIN 산하), Apache 2.0으로 출시되었으며, Ollama와 llama.cpp에서 직접 실행되는 GGUF 가중치를 제공합니다.
  • 벤치마크 격차는 실재합니다: ALLaM-7B는 AraLingBench에서 72–74%를 기록하는 반면 Qwen 변형은 40–62%를 기록합니다 — 아랍어 언어 작업에서 12–32 퍼센트 포인트의 격차입니다.
  • AceGPT (KAUST + CUHKSZ + SRIBD)는 7B/13B Apache 2.0 대안이지만, 마지막 GitHub 업데이트가 2023년 12월이었습니다 — 유지 관리되지 않는 것으로 간주하십시오.
  • 문화적 충실도 ≠ 문법적 유창성. 글로벌하게 학습된 모델은 문법적으로 정확하더라도 문화적으로 틀릴 수 있습니다. 다국어 모델을 아랍어로 미세 조정하면 종종 MSA 품질은 *향상*되지만 방언 정확도는 *저하*됩니다 — 문서화된 역설입니다.
  • VRAM 빠른 참조 (Q4_K_M): 7B ≈ 6–8 GB, 13B ≈ 10–14 GB, 34B ≈ 20–24 GB, 70B ≈ 40–48 GB.
  • ALLaM 34B는 독점입니다 — HUMAIN Chat을 구동하지만 공개 가중치가 없으므로, 오늘날 자체 호스팅 가능한 것은 7B뿐입니다.
  • 국가적 추진력: 사우디아라비아는 2026년을 인공지능의 해로 선언하여 아랍어 모델 개발을 가속화하고 있습니다.

ALLaM 7B (Apache 2.0, Ollama 지원)는 공개적으로 자체 호스팅 가능한 선도적 아랍어 모델로, AraLingBench에서 72–74%를 기록하며 Qwen 변형의 40–62%를 능가합니다.

자체 컴퓨터에서 실행할 수 있는 아랍어 AI가 필요하다면, 사우디아라비아의 ALLaM 7B가 현재 가장 좋은 무료 옵션입니다. Qwen 같은 대형 글로벌 모델은 아랍어 문법은 이해하지만 문화와 방언은 자주 놓칩니다.

로컬 AI에서 아랍어 문화적 충실도가 중요한 이유

모델은 문법적으로 정확한 아랍어를 생성하면서도 여전히 문화적으로 틀릴 수 있습니다 — 그리고 사우디아라비아의 고객 대면 또는 정부 업무에서는 문화적 정확성이 중요한 것입니다.

벤치마크 증거는 일관됩니다. 아랍어 형태론적 및 통사론적 추론을 테스트하는 AraLingBench에서 Qwen 계열 모델은 40–62%를 기록하는 반면 ALLaM-7B 같은 아랍어 특화 모델은 72–74%를 기록합니다. 그 12–32 퍼센트 포인트의 격차는 정확히 — 형태론, 통사론, 격식 — 아랍어가 글로벌 모델이 최적화된 유럽 언어와 가장 크게 다른 영역에 집중됩니다.

미세 조정은 무료 해결책이 아닙니다. 아랍어 LLM 환경에 대한 연구 (arXiv 2506.01340, 2026)는 역설을 문서화합니다: 다국어 모델을 아랍어 데이터로 미세 조정하면 종종 현대 표준 아랍어 (MSA) 품질은 향상되지만 방언 정확도는 *저하*됩니다. 단순히 글로벌 모델에 아랍어 역량을 덧붙여 방언 충실도를 기대할 수는 없습니다.

방언 처리는 글로벌 모델이 가장 눈에 띄게 무너지는 지점입니다. 더 작은 오픈 웨이트 모델의 경우, 엄격한 ISO 코드 방언 정확도가 0.016–0.078까지 낮게 떨어질 수 있습니다 — 즉 모델이 *잘못된* 방언으로 유창한 아랍어를 생성한다는 의미입니다. AraDiCE 벤치마크 (COLING 2025)는 아랍어 특화 모델이 방언에서 다국어 모델을 능가한다는 것을 발견하지만, 방언 식별 및 생성에서의 상당한 과제는 모든 모델에 걸쳐 지속됩니다.

문화적 및 종교적 맥락은 문서화된 약점입니다. 같은 조사는 서구 중심적 또는 다국어 학습 데이터가 "모델을 아랍어 사용 커뮤니티의 가치와 기대와 어긋나게 만들 수 있는 문화적 편향을 도입한다"고 언급합니다 — 이는 모델이 이슬람 주제, 격식 있는 호칭, 그리고 사회적 관습을 어떻게 다루는지에 영향을 미칩니다.

문법적 성 일치는 알려진, 지속적인 과제입니다: 아랍어는 동사, 형용사, 대명사에 유럽 언어와 구조적으로 다른 방식으로 성 일치를 적용하며, 글로벌하게 학습된 모델은 이를 일상적으로 미묘하게 틀립니다.

사우디 배포에 대한 비즈니스적 함의: 사용 사례가 고객 대면 아랍어 콘텐츠, 격식 있는 서신, 또는 문화적이거나 종교적인 맥락에 관련된 무엇이든이라면, 아랍어 특화 모델은 그 트레이드오프의 가치가 있습니다 — 그리고 MSA 대 걸프 방언의 구별은 모델 선택의 명시적인 부분이 되어야 합니다.

사우디 및 아랍어 로컬 모델: ALLaM, AceGPT, 그리고 다국어 대안

ALLaM 7B는 자체 호스팅 아랍어 AI를 위한 권장 시작점입니다. 아래 표는 현실적인 옵션을 요약합니다.

ALLaM은 SDAIA의 국가 AI 센터 (NCAI)가 IBM과 협력하여 구축했으며, 현재는 2025년 5월에 출범한 Public Investment Fund 소유의 AI 회사인 HUMAIN을 통해 상용화되고 있습니다. 이 제품군은 7B, 13B, 34B, 70B 변형에 걸쳐 있지만, 7B Instruct만 공개적으로 이용 가능합니다 (Apache 2.0, Hugging Face의 9개 GGUF 양자화 포함). HUMAIN Chat을 구동하는 34B는 공개 가중치가 없는 독점입니다.

AceGPT는 KAUST, 홍콩중문대학교 선전 (CUHKSZ), 그리고 선전 빅데이터 연구소 (SRIBD)의 공동 프로젝트입니다 — KAUST 단독 모델이 아닙니다. LLaMA-2를 기반으로 구축된 7B 및 13B 변형 (base 및 chat)을 Apache 2.0으로 제공합니다. 2023년 출시 당시 아랍어 작업에서 Jais를 능가했지만, 마지막 GitHub 업데이트가 2023년 12월이었으므로 유지 관리되지 않는 것으로 간주하십시오.

Qwen2.5는 광범위한 언어 커버리지를 위한 가장 강력한 다국어 대안이지만, 벤치마크가 보여주듯이 더 큰 생태계에도 불구하고 문화 및 방언 작업에서는 아랍어 특화 모델에 뒤처집니다.

Jais (13B/70B)는 완전성을 위해 포함되었지만, UAE 출신 (Core42/G42, 아부다비)이며 사우디가 아니라는 점에 유의하십시오. 아랍어 방언 작업에서 경쟁력을 유지하며 Apache 2.0입니다.

모델파라미터VRAM (Q4_K_M)라이선스Ollama아랍어 점수
ALLaM 7B7B6–8 GBApache 2.0예 (GGUF)72–74% (AraLingBench)
ALLaM 34B34B~20 GB독점아니요 (공개 가중치 없음)공개 벤치마크 없음
AceGPT 7B7B6–8 GBApache 2.0커뮤니티 포팅출시 당시 강력함 (2023)
AceGPT 13B13B10–14 GBApache 2.0커뮤니티 포팅출시 당시 강력함 (2023)
Qwen2.5 7B7B6–8 GBApache 2.040–62% (AraLingBench)
Qwen2.5 72B72B40–48 GBApache 2.0더 높지만 문화적 격차는 남아 있음
Jais 13B (UAE)13B10–14 GBApache 2.0제한적방언에서 경쟁력 있음
AraLingBench 점수 비교: ALLaM 7B는 72–74%, Qwen2.5 7B는 40–62%를 기록해 아랍어 언어 과제에서 최대 32퍼센트포인트 차이를 보입니다.
AraLingBench 점수 비교: ALLaM 7B는 72–74%, Qwen2.5 7B는 40–62%를 기록해 아랍어 언어 과제에서 최대 32퍼센트포인트 차이를 보입니다.

Ollama로 ALLaM 7B 로컬 실행하기

ALLaM 7B는 Hugging Face에서 GGUF 양자화로 제공되므로, 한 줄짜리 Modelfile로 Ollama에서 실행할 수 있습니다. 다음 단계를 따르십시오.

  • 대안 — llama.cpp 직접 사용: llama-cli -m ALLaM-7B-Instruct-Q4_K_M.gguf --chat-template chatml -p "أكمل الجملة التالية:" 로 컨텍스트 길이와 샘플링을 최대한 제어할 수 있습니다.
  • 커뮤니티 포팅을 통한 AceGPT: ollama run salmatrafi/acegpt 는 비교하고 싶다면 커뮤니티가 유지 관리하는 AceGPT 포팅을 가져옵니다.
  • 최소 하드웨어: 8 GB VRAM GPU (RTX 3070/4060 이상) 또는 16 GB 통합 메모리를 갖춘 Apple Silicon. 더 큰 모델의 크기는 VRAM 계산기로 측정하십시오.
  1. 1
    Hugging Face에서 GGUF 다운로드
    Why it matters: Hugging Face에서 humain-ai/ALLaM-7B-Instruct-preview를 방문하여 양자화를 둘러보고 ALLaM-7B-Instruct-Q4_K_M.gguf (권장, ~4.5 GB)를 다운로드하십시오 — 8 GB GPU에 가장 좋은 품질 대 크기 균형입니다.
  2. 2
    Ollama 설치
    Why it matters: 사용 중인 OS에 맞게 ollama.com에서 Ollama를 다운로드하십시오. 7B 모델을 편안하게 실행하려면 NVIDIA GPU의 VRAM 약 8 GB, 또는 Apple Silicon의 통합 메모리 16 GB가 필요합니다.
  3. 3
    Modelfile 생성
    Why it matters: Modelfile이라는 이름의 일반 텍스트 파일을 한 줄로 생성하십시오: FROM ./ALLaM-7B-Instruct-Q4_K_M.gguf — 이는 Ollama에게 가중치를 어디서 찾을지 알려줍니다.
  4. 4
    Ollama에 모델 등록
    Why it matters: 실행: ollama create allam-7b -f Modelfile. Ollama가 GGUF를 가져와서 반복적으로 호출할 수 있는 명명된 모델로 사용 가능하게 만듭니다.
  5. 5
    아랍어로 추론 실행
    Why it matters: 실행: ollama run allam-7b "اشرح مفهوم الذكاء الاصطناعي المحلي" (로컬 AI 개념을 설명하십시오). 모델은 현대 표준 아랍어로 응답합니다.
  6. 6
    아랍어 출력 검증 및 조정
    Why it matters: 모델이 영어로 응답하면, "أجب دائماً باللغة العربية الفصحى" (항상 현대 표준 아랍어로 응답하십시오)와 같은 시스템 프롬프트를 추가하여 격식과 언어를 고정하십시오.
Q4_K_M 양자화 기준 크기별 로컬 LLM VRAM 요구량: 7B 모델은 6–8GB, 13B는 10–14GB, 34B는 20–24GB, 70B는 40–48GB가 필요합니다.
Q4_K_M 양자화 기준 크기별 로컬 LLM VRAM 요구량: 7B 모델은 6–8GB, 13B는 10–14GB, 34B는 20–24GB, 70B는 40–48GB가 필요합니다.

아랍어 모델 품질을 직접 평가하는 방법

벤치마크는 시작점이지만, 배포하기 전에 어떤 아랍어 모델이든 자체 도메인에 대해 테스트해야 합니다. 다음 검사를 사용하십시오.

  • MSA 대 방언 일관성: 동일한 프롬프트를 현대 표준 아랍어와 걸프 방언으로 보내고, 모델이 둘 모두에서 격식과 의미를 유지하는지 확인하십시오.
  • 문화적 맥락 테스트: 사우디 문화 관행, 이슬람 금융 원칙, 또는 격식 있는 호칭 관습에 대해 물어보고 — 단지 문법적으로 유효한지가 아니라 그 표현이 적절한지 확인하십시오.
  • 성 일치 테스트: 모델에게 여성 의사와 남성 엔지니어를 묘사하도록 요청하고, 동사, 형용사, 대명사에서 올바른 아랍어 문법적 성 일치를 검증하십시오.
  • 격식 보정: 격식 있는 편지를 요청한 다음 캐주얼한 메시지를 요청하십시오 — 좋은 모델은 격식을 조정하고, 약한 모델은 둘 다에 같은 어조를 사용합니다.
  • 벤치마크 프록시: 모델을 비교할 때 AraLingBench (형태론적 및 통사론적 추론)와 AraDiCE (문화적 인식 및 방언)를 게시된 참조 지점으로 사용하십시오.
  • 위험 신호: 아랍어 프롬프트에 대한 라틴 문자 응답, 잘못된 방언 격식, 또는 종교 주제의 문화적으로 부적절한 표현은 모두 부적합을 나타냅니다.
  • 실용적 규칙: 고객 대면 아랍어 사용 사례의 경우, 배포하기 전에 최소 20개의 도메인별 프롬프트로 테스트하십시오 — 벤치마크 점수는 귀하의 특정 콘텐츠를 포착하지 못합니다.

자주 묻는 질문: 아랍어 로컬 LLM

ALLaM이란 무엇이며 누가 만들었습니까?

ALLaM은 SDAIA의 국가 AI 센터 (NCAI)가 IBM과 협력하여 구축한 아랍어 언어 모델 제품군이며, 현재는 Public Investment Fund 소유의 AI 회사인 HUMAIN을 통해 상용화되고 있습니다. 7B Instruct 버전은 Apache 2.0으로 공개적으로 이용 가능합니다. 더 큰 13B, 34B, 70B 변형이 존재하지만, 7B만 오픈 웨이트를 가지고 있습니다.

ALLaM을 로컬에서 실행할 수 있습니까?

예 — ALLaM 7B Instruct 모델은 Hugging Face에 GGUF 양자화가 있어 VRAM 약 8 GB를 갖춘 GPU 또는 16 GB 통합 메모리를 갖춘 Apple Silicon에서 Ollama와 llama.cpp로 직접 실행됩니다. HUMAIN Chat을 구동하는 34B는 독점이며 자체 호스팅할 수 없습니다.

AceGPT란 무엇이며 여전히 유지 관리됩니까?

AceGPT는 KAUST, CUHKSZ, 그리고 SRIBD가 공동 개발한 아랍어 모델로, Apache 2.0으로 7B 및 13B 변형을 제공합니다. 2023년 출시 당시 Jais를 능가했지만, 마지막 GitHub 업데이트가 2023년 12월이었으므로 유지 관리되지 않는 것으로 보입니다 — 사용 가능하지만 적극적으로 개선되지는 않습니다.

ALLaM은 아랍어에서 Qwen과 어떻게 비교됩니까?

AraLingBench에서 ALLaM-7B는 72–74%를 기록하는 반면 Qwen 변형은 40–62%를 기록합니다 — 아랍어 언어 작업에서 12–32 퍼센트 포인트의 격차입니다. Qwen은 더 큰 생태계와 더 광범위한 다국어 커버리지를 가지고 있지만, ALLaM은 아랍어 특화 형태론, 통사론, 그리고 문화적 작업에서 더 강합니다.

다국어 모델이 아랍어에서 어려움을 겪는 이유는 무엇입니까?

일반적으로 문법적으로 유창하지만 문화적으로 그리고 방언적으로 약합니다. 엄격한 방언 정확도는 더 작은 모델의 경우 0.016–0.078까지 떨어질 수 있으며, 다국어 모델을 아랍어로 미세 조정하면 종종 MSA 품질은 향상되지만 방언 정확도는 저하됩니다 — 문서화된 역설입니다. 서구 중심적 학습 데이터는 또한 모델이 이슬람 및 사회적 맥락을 다루는 방식에 문화적 편향을 도입합니다.

7B 아랍어 모델에는 어떤 VRAM이 필요합니까?

Q4_K_M 양자화에서 VRAM 약 6–8 GB가 필요하며, 편안한 성능을 위해서는 8 GB 이상을 권장합니다. 13B 모델은 10–14 GB, 34B는 약 20–24 GB, 70B는 약 40–48 GB가 필요합니다.

Jais는 사우디 모델입니까?

아니요 — Jais는 UAE 출신으로, 사우디 기관이 아니라 아부다비의 Core42/G42가 개발했습니다. 방언 작업에서 경쟁력 있는 유능한 Apache 2.0 아랍어 모델이기 때문에 여기에 포함되었지만, 사우디 (ALLaM/AceGPT) 계보의 일부는 아닙니다.

ALLaM 34B를 사용해야 합니까 아니면 7B를 사용해야 합니까?

로컬 배포의 경우 7B를 사용하십시오 — 34B는 독점이며 자체 호스팅할 수 없습니다. 자체 하드웨어에서 ALLaM 7B로 시작하고, 34B 역량이 필요하다면 다운로드 가능한 가중치를 기대하기보다는 HUMAIN Chat 제품을 통해 접근하십시오.

모델이 사우디 아랍어를 올바르게 처리하는지 어떻게 테스트합니까?

MSA 대 방언 일관성 프롬프트를 실행하고, 사우디 문화 관행과 이슬람 금융에 대해 물어보고, 문법적 성 일치를 테스트하십시오 (예: 여성 의사와 남성 엔지니어 묘사). 라틴 문자 응답, 잘못된 방언 격식, 또는 문화적으로 부적절한 표현을 주의하고, 배포하기 전에 최소 20개의 도메인별 프롬프트로 검증하십시오.

HUMAIN이란 무엇입니까?

HUMAIN은 Public Investment Fund가 전액 소유한 사우디아라비아 AI 기업으로 2025년 5월에 설립되었습니다. ALLaM을 상용화하고 HUMAIN Chat을 운영합니다. SDAIA와는 별개 조직이지만 SDAIA의 국립 AI 센터(NCAI)에서 ALLaM 모델을 인계받았습니다. 이후 Aramco가 소수 지분을 인수했습니다.

출처

  • Hugging Face — humain-ai/ALLaM-7B-Instruct-preview (모델 카드, GGUF 양자화) — huggingface.co
  • AraLingBench — 아랍어 언어 벤치마크 (arXiv 2511.14295) — arxiv.org
  • Landscape of Arabic LLMs — 조사 (arXiv 2506.01340) — arxiv.org
  • AraDiCE — 아랍어 방언 및 문화 평가, COLING 2025 (arXiv 2409.11404) — arxiv.org
  • ALLaM 34B 기반 HUMAIN Chat 출시 — Middle East AI News — middleeastainews.com
  • 사우디 내각 — 2026년을 인공지능의 해로 선언 — spa.gov.sa

A Note on Third-Party Facts

This article references third-party AI models, benchmarks, prices, and licenses. The AI landscape changes rapidly. Benchmark scores, license terms, model names, and API prices can shift between the time of writing and the time you read this. Before making deployment or compliance decisions based on this article, verify current figures on each provider’s official source: Hugging Face model cards for licenses and benchmarks, provider websites for API pricing, and EUR-Lex for current GDPR and EU AI Act text. This article reflects publicly available information as of May 2026.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Download the PromptQuorum Beta →

← Back to Local LLMs