Skip to main content
PromptQuorumPromptQuorum
/고급 로컬 LLM/2026년 모바일 LLM 최고 모델: Phi-4 Mini vs Gemma 3 vs SmolLM 비교
Mobile & Edge LLMs

2026년 모바일 LLM 최고 모델: Phi-4 Mini vs Gemma 3 vs SmolLM 비교

·12분 분량·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

2026년 고사양 스마트폰(RAM 8GB 이상) 대부분에서 Q4_K_M 양자화의 Phi-4 Mini (3.8B)가 실용적인 속도로 구동되는 가장 스마트한 모델입니다(iPhone 17 Pro 기준 ~13–18 토큰/초). RAM 6GB 구형 폰에서는 Qwen 3 1.7B 또는 SmolLM 2 1.7B가 편안하게 구동되며 짧고 일관된 응답을 생성합니다. SmolLM 2 1.7B는 테스트된 모든 기기에서 초당 토큰 수가 가장 빠릅니다. Qwen 3 1.7B는 최고의 다국어 모델입니다(35개 이상 언어, 중국어·일본어·아랍어 포함). Gemma 3 4B는 앱에서 Phi-4 Mini를 사용할 수 없을 때의 균형 잡힌 표준 모델입니다. Gemma 3 1B는 매우 구형 폰(RAM 4GB)을 위한 경량 옵션입니다. Llama 3.2 3B는 가장 광범위한 도구 지원을 갖춘 검증된 만능 3B 모델입니다.

2026년 모바일 사용 사례 대부분을 커버하는 소형 언어 모델 6종을 소개합니다: Phi-4 Mini (3.8B), Gemma 3 4B, Gemma 3 1B, SmolLM 2 1.7B, Qwen 3 1.7B, Llama 3.2 3B. 각 모델은 초당 토큰 수, 메모리 소모량, 채팅·요약·번역·단문 작성 품질에서 차이를 보입니다. 이 가이드에서는 iPhone 17 Pro와 Galaxy S25 Ultra에서 비교 테스트를 진행하고, 기기 등급별(고사양·중급·보급형) 추천 모델을 제시하며, 모바일 표준 양자화 방식인 Q4_K_M이 왜 최선인지 설명합니다.

2026년 모바일 LLM 최고 모델: Phi-4 Mini vs Gemma 3 vs SmolLM 비교

핵심 요점

  • Phi-4 Mini (3.8B)는 2026년 가장 스마트한 소형 모델입니다. RAM 8GB 이상 고사양 폰에 최적 — iPhone 17 Pro에서 ~13–18 토큰/초, iPhone 16 Pro에서 ~10–15 토큰/초로 구동됩니다. 4B 미만 모델 중 파라미터당 추론 능력이 가장 뛰어납니다.
  • SmolLM 2 1.7B는 테스트된 모든 폰에서 초당 토큰 수가 가장 빠릅니다. iPhone 17 Pro에서 ~26–32 토큰/초, Galaxy S25 Ultra에서 ~20–28 토큰/초. 응답 깊이보다 속도가 중요할 때(빠른 채팅, 자동완성 작업) 최적입니다.
  • Qwen 3 1.7B는 최고의 모바일 다국어 모델입니다. 중국어, 일본어, 아랍어, 독일어를 포함한 35개 이상 언어에서 네이티브 수준 출력으로 훈련되었습니다. 번역, 다른 언어 작성, 여행 시 사용에 최적입니다.
  • Gemma 3 4B는 균형 잡힌 기본 선택입니다. 동일 하드웨어에서 Phi-4 Mini보다 약간 느리지만 채팅 및 요약에서 비슷한 성능을 보입니다. 앱에서 Phi-4 Mini를 사용할 수 없거나 Google 훈련 데이터 조합을 선호할 때 최적입니다.
  • Gemma 3 1B는 구형 폰을 위한 경량 선택입니다. RAM 4GB에서 구동됩니다(iPhone SE 3세대, 구형 Android). 다단계 추론은 제한적이지만, 약한 하드웨어에서 다른 모델보다 빠르게 1–2문단의 일관된 응답을 생성합니다.
  • Llama 3.2 3B는 가장 검증된 만능 3B 모델입니다. 6종 중 도구 호출 지원이 가장 우수하고, 앱 호환성이 높으며, 커뮤니티 파인튜닝 생태계가 가장 큽니다. 순수 품질에서는 Phi-4 Mini에 약간 뒤지지만 엣지 케이스에서 더 안정적입니다.
  • Q4_K_M은 2026년 모바일 LLM 추론의 표준 양자화 방식입니다. 파일 크기를 1/4로 줄이면서 원본 품질의 ~95%를 유지합니다. Q5_K_M이나 Q6_K는 RAM 12GB 이상 폰(iPhone 17 Pro Max)에서 앱이 지원하는 경우에만 사용합니다.

빠른 팩트

  • 테스트된 모델: Phi-4 Mini 3.8B, Gemma 3 4B, Gemma 3 1B, SmolLM 2 1.7B, Qwen 3 1.7B, Llama 3.2 3B (모두 Q4_K_M GGUF).
  • 테스트 기기: iPhone 17 Pro (A19 Pro), iPhone 16 Pro (A18 Pro, 8 GB), Galaxy S25 Ultra (Snapdragon 8 Elite), Pixel 9 Pro (Tensor G5), OnePlus 13 (Snapdragon 8 Elite).
  • 추론 엔진: llama.cpp via PocketPal AI / LLM Farm (기본값), MLC LLM via MLC Chat (iPhone Metal 가속), Ollama via Termux (Android).
  • 메모리 사용량 (Q4_K_M): Phi-4 Mini ~2.7 GB, Gemma 3 4B ~2.9 GB, Llama 3.2 3B ~2.2 GB, Qwen 3 1.7B ~1.1 GB, SmolLM 2 1.7B ~1.1 GB, Gemma 3 1B ~720 MB.
  • 최소 RAM (활성): 1.7B 모델은 6GB 폰; 3B–4B 모델은 8GB; Gemma 3 1B만 4GB 가능.
  • iPhone 17 Pro 최고 토큰/초: Gemma 3 1B ~35–45, SmolLM 2 ~26–32, Qwen 3 ~24–32, Llama 3.2 3B ~16–22, Phi-4 Mini ~13–18, Gemma 3 4B ~10–13.
  • 양자화 소스: 6종 모두 Hugging Face에서 Q4_K_M GGUF로 제공되며 PocketPal AI / MLC Chat / LM Studio를 통해서도 사용 가능합니다.

어떤 모바일 모델을 선택해야 합니까?

대부분의 고사양 폰(iPhone 16 Pro / 17 Pro, Galaxy S25 Ultra, OnePlus 13)에서는 Phi-4 Mini (3.8B Q4_K_M)를 선택하십시오. 4B 미만 중 가장 스마트한 모델이며 실용적인 대화 속도로 구동됩니다. 특정 필요에 해당하는 경우에만 다른 모델을 선택하십시오 — 속도(SmolLM 2), 다국어(Qwen 3), 구형 폰 호환성(Gemma 3 1B).

📍 한 문장으로

8GB 이상 고사양에는 Phi-4 Mini(가장 스마트), 속도에는 SmolLM 2 1.7B, 다국어에는 Qwen 3 1.7B, 4GB 폰에는 Gemma 3 1B, 도구 호출에는 Llama 3.2 3B, Phi-4 Mini를 사용할 수 없을 때 균형 선택으로 Gemma 3 4B를 사용하십시오.

💬 쉽게 말하면

모바일에서 단 하나의 최고 모델은 없습니다 — 올바른 선택은 폰과 사용 목적에 따라 다릅니다. 최근 2년 이내 폰이고 RAM이 8GB 이상이라면 Phi-4 Mini를 설치하십시오. 영어 외 언어로 주로 채팅한다면 Qwen 3를 설치하십시오. 품질을 약간 희생하더라도 가장 빠른 응답을 원한다면 SmolLM 2를 설치하십시오. 폰이 구형이거나 RAM이 4GB뿐이라면 Gemma 3 1B를 설치하십시오. 모델 간 차이는 실제로 존재하지만 어떤 모델이든 일관된 응답을 생성합니다.

결정: 어떤 모바일 모델을 선택합니까?

Use a local LLM if:

  • RAM 8GB 이상 고사양 폰 (iPhone 16 Pro/17 Pro, Galaxy S25 Ultra, OnePlus 13) → Phi-4 Mini 3.8B
  • 모든 폰에서 가장 빠른 토큰/초가 필요한 경우 → SmolLM 2 1.7B
  • 영어 외 언어 사용 (번역, 다국어 채팅) → Qwen 3 1.7B
  • 광범위한 앱 호환성, 도구 호출 또는 RAG가 필요한 경우 → Llama 3.2 3B
  • RAM 4GB 구형 폰 → Gemma 3 1B
  • 앱에서 Phi-4 Mini를 사용할 수 없고 4B급 품질이 필요한 경우 → Gemma 3 4B

Use a cloud model if:

  • 다단계 추론, 복잡한 코드 생성, 긴 문서 분석 → 클라우드 사용 또는 70B 이상 모델을 갖춘 홈 PC에 원격 연결
  • 비전-언어 작업 (이미지 입력, OCR) → 클라우드 앱 (2026년 모바일 비전 모델은 제한적이고 느림)
  • 3,000 토큰 이상에서 일관성이 중요한 긴 창작 글쓰기 → 클라우드 또는 데스크톱의 8B 이상

Quick decision:

  • 대부분의 기본 선택: Phi-4 Mini 3.8B
  • 모든 기기에서 가장 빠름: SmolLM 2 1.7B
  • 최고의 다국어: Qwen 3 1.7B
4단계 모바일 LLM 선택 가이드: 폰 RAM 확인, 등급 선택(4GB~8GB 이상), 사용 사례 선택(속도·다국어·품질), 그런 다음 PocketPal AI 또는 LM Studio를 통해 Q4_K_M GGUF 설치.
4단계 모바일 LLM 선택 가이드: 폰 RAM 확인, 등급 선택(4GB~8GB 이상), 사용 사례 선택(속도·다국어·품질), 그런 다음 PocketPal AI 또는 LM Studio를 통해 Q4_K_M GGUF 설치.

💡Tip: 확실하지 않다면 고사양 폰에서는 Phi-4 Mini, 중급 폰에서는 SmolLM 2 1.7B로 시작하십시오 — 빠른 연결로 5분 이내에 다운로드할 수 있으며 되돌릴 수 있습니다. 실제로 중요한 작업으로 테스트해 보십시오. 품질이 수용 가능하다면 기본 모델이 결정됩니다. PocketPal AI나 LM Studio를 통해 30초 만에 변경할 수 있습니다.

모바일 모델 비교 표

아래 4열 표는 빠른 선택을 위한 레이어입니다 — 기기 등급이나 사용 사례에 맞는 행을 하나 선택하십시오. 토큰/초 수치는 PocketPal AI (llama.cpp)로 iPhone 17 Pro에서 Q4_K_M 양자화를 사용한 기준입니다. iPhone 16 Pro에서는 15–25% 낮고, Galaxy S25 Ultra에서 MLC Chat 또는 Termux+Ollama 사용 시 약 10–20% 낮습니다.

📍 한 문장으로

Phi-4 Mini는 가장 스마트, SmolLM 2 1.7B는 가장 빠름, Qwen 3 1.7B는 최고 다국어, Gemma 3 1B는 가장 작은 실용 모델, Llama 3.2 3B는 최고 만능 3B, Gemma 3 4B는 균형 잡힌 기본 선택입니다.

💬 쉽게 말하면

이 표를 위에서 아래로 크기 순으로 읽거나 기기 등급에 해당하는 행으로 바로 이동하십시오. 최적 용도 열은 모델이 최적화하는 것을 나타냅니다 — 가장 중요한 강점이 있는 행을 선택하고 나머지는 무시하십시오.

모델크기토큰/초 (17 Pro)최적 용도
Phi-4 Mini3.8B~13–18가장 스마트한 소형 모델 — 고사양 기본 선택
Gemma 3 4B4B~10–13Phi-4 Mini를 사용할 수 없을 때 균형 선택
Gemma 3 1B1B~35–45구형 폰 (RAM 4GB)
SmolLM 21.7B~26–32가장 빠른 토큰/초, 빠른 채팅
Qwen 31.7B~24–32최고 다국어 (35개 이상 언어)
Llama 3.23B~16–22최고의 만능 3B 선택, 도구 호출, RAG

속도-품질 트레이드오프: 동일 칩에서 토큰/초는 파라미터 수에 반비례합니다. Microsoft 훈련 데이터 조합 덕분에 Phi-4 Mini (3.8B)의 추론 품질은 1.7B보다 7B 모델에 가깝습니다.

iPhone 17 Pro에서 Q4_K_M으로 비교한 모바일 LLM 6종: Phi-4 Mini (3.8B, ~13–18 토큰/초)가 가장 스마트; SmolLM 2 (1.7B, ~26–32 토큰/초)가 가장 빠름; Qwen 3 (1.7B)가 최고 다국어; Gemma 3 1B (~35–45 토큰/초)는 4GB 폰에서도 작동.
iPhone 17 Pro에서 Q4_K_M으로 비교한 모바일 LLM 6종: Phi-4 Mini (3.8B, ~13–18 토큰/초)가 가장 스마트; SmolLM 2 (1.7B, ~26–32 토큰/초)가 가장 빠름; Qwen 3 (1.7B)가 최고 다국어; Gemma 3 1B (~35–45 토큰/초)는 4GB 폰에서도 작동.

💡Tip: iPhone 16 Pro의 토큰/초는 모든 모델에서 iPhone 17 Pro보다 약 15–25% 낮습니다. Galaxy S25 Ultra (Snapdragon 8 Elite)는 동일 Q4_K_M GGUF에서 iPhone 17 Pro보다 약 10–20% 낮습니다.

Phi-4 Mini: 가장 스마트한 소형 모델

Phi-4 Mini (파라미터 3.8B, Microsoft, 2024년 12월)는 최적화된 훈련 데이터 조합 덕분에 2026년 4B 미만 중 가장 스마트한 모델입니다. 비슷한 크기에도 불구하고 chain-of-thought 작업에서 Gemma 3 4B와 Llama 3.2 3B를 능가합니다. RAM 8GB 이상 모든 폰에서 기본 모델로 사용하십시오.

  • 파라미터 및 훈련: 파라미터 3.8B; 고품질 웹 텍스트, 합성 추론 체인, 학술 콘텐츠로 구성된 Microsoft 큐레이션 조합으로 훈련됨. 아키텍처는 grouped-query attention을 갖춘 Transformer.
  • 메모리 사용량: Q4_K_M에서 ~2.7 GB, Q5_K_M에서 ~3.5 GB. iPhone 16 Pro / 17 Pro (8 GB)와 Galaxy S25 Ultra (12 GB)에서 OS 여유 공간을 충분히 남기고 편안하게 구동됩니다.
  • 속도 (토큰/초): iPhone 17 Pro ~13–18, iPhone 16 Pro ~10–15, Galaxy S25 Ultra ~10–15 (Termux+Ollama), iPhone 14 Pro ~6–10 (느리지만 작동 가능).
  • 품질 강점: chain-of-thought 추론, 요약, 사실 기반 Q&A, 기본 코드 생성. 표준 벤치마크(MMLU, GSM8K)에서 비슷한 크기의 오픈소스 모델을 능가합니다.
  • 품질 약점: Llama 3.2 3B보다 제한적인 세계 지식; Gemma 3 4B보다 짧은 자연스러운 창작 문체; 영어 외에서 Qwen 3 1.7B보다 약한 다국어 성능.
  • 최적 용도: 영어 채팅, 요약, 추론에서 최고의 단일 기본 모델을 원하는 고사양 폰 사용자.

💡Tip: Phi-4 Mini는 단계별 추론을 명시적으로 요청하는 시스템 프롬프트의 이점을 받습니다. 훈련 데이터에 추론 체인이 많이 포함되어 있기 때문에 이러한 스타일의 지시를 사용하면 간결한 프롬프트보다 체계적으로 더 나은 응답이 나옵니다. 빠른 채팅에는 시스템 프롬프트가 필요하지 않습니다; 기본 동작이 이미 대화형입니다.

Gemma 3 4B: 균형 잡힌 선택

Gemma 3 4B (Google DeepMind, 2025)는 앱에서 Phi-4 Mini를 사용할 수 없거나 Google 훈련 데이터 조합을 선호할 때 균형 잡힌 기본 선택입니다. 동일 하드웨어에서 Phi-4 Mini보다 약간 느리지만 채팅과 요약에서 비슷한 성능을 보이며 더 넓은 자연어 범위를 갖습니다.

  • 파라미터 및 훈련: 파라미터 4B; Google 큐레이션 웹 텍스트, 코드, 다국어 데이터 조합으로 훈련됨. 확장된 컨텍스트를 갖춘 Gemma 2와 같은 계열 아키텍처.
  • 메모리 사용량: Q4_K_M에서 ~2.9 GB, Q5_K_M에서 ~3.7 GB. 8GB 이상 폰에 적합; 6GB 폰에서는 빠듯합니다.
  • 속도 (토큰/초): iPhone 17 Pro ~10–13, iPhone 16 Pro ~7–10, Galaxy S25 Ultra ~7–10.
  • 품질 강점: 자연스러운 대화 톤, 탄탄한 요약, Phi-4 Mini보다 넓은 세계 지식, 무난한 다국어 성능.
  • 품질 약점: Phi-4 Mini보다 약한 chain-of-thought 추론; 동일 하드웨어에서 더 느린 토큰/초.
  • 최적 용도: 일상 채팅, 요약, 단문 작성에서 Phi-4 Mini 대안으로 Google 훈련 모델을 원하는 고사양 사용자.

💡Tip: Gemma 3 4B는 Phi-4 Mini와 다른 채팅 템플릿을 사용합니다 — 앱이 올바른 Gemma 템플릿(<start_of_turn> 마커 포함)을 사용하는지 확인하십시오. 잘못된 템플릿은 깨지거나 반복되는 출력을 생성합니다. PocketPal AI, MLC Chat, LM Studio는 자동으로 감지합니다; LLM Farm은 수동으로 선택해야 합니다.

Gemma 3 1B: 구형 폰용 경량 선택

Gemma 3 1B (Google DeepMind, 2025)는 2026년 가장 작은 실용적인 모바일 모델입니다 — Q4_K_M에서 ~720 MB이며 4GB 폰에서 구동됩니다. 품질은 짧고 일관된 응답(1–2문단)으로 제한되지만, 약한 하드웨어에서 실용적인 출력을 생성하는 1GB 미만 유일한 모델입니다.

  • 파라미터 및 훈련: 파라미터 1B; 4B 모델과 같은 Gemma 3 계열 아키텍처. 엣지 기기에서의 효율적인 추론을 위해 훈련됨.
  • 메모리 사용량: Q4_K_M에서 ~720 MB, Q5_K_M에서 ~900 MB. iPhone SE 3세대, iPhone 12/13, 구형 Android(최소 RAM 4GB)에서 작동합니다.
  • 속도 (토큰/초): iPhone 17 Pro ~35–45, iPhone 16 Pro ~28–38, iPhone 14 ~20–28, 구형 Android (4 GB) ~10–15. 이 그룹에서 모든 기기에서 가장 빠른 모델.
  • 품질 강점: 속도, 낮은 메모리 사용량, 짧고 일관된 응답, 낮은 배터리 소모.
  • 품질 약점: 약한 다단계 추론, 특정 주제에서 빈번한 사실 오류, 긴 생성에서 반복, 얕은 대화 깊이.
  • 최적 용도: RAM 6GB 임계값 이하 폰에서도 온디바이스 AI를 원하는 사용자, 또는 배터리 수명을 최적화하는 사용자.

💡Tip: Gemma 3 1B는 짧고 집중된 작업에 사용하십시오 — 한 문장 요약, 한 문단 초안, 빠른 정의, 간단한 번역. 여러 문단 설명, 다단계 추론, 특정 사실의 정확도가 중요한 것은 피하십시오.

SmolLM 2 1.7B: 초당 토큰 수 최고

SmolLM 2 1.7B (Hugging Face, 2024)는 테스트된 모든 폰에서 이 그룹 내 초당 토큰 수가 가장 빠른 모바일 모델입니다. iPhone 17 Pro에서 ~26–32 토큰/초, Galaxy S25 Ultra에서 ~20–28 토큰/초. 응답 깊이보다 속도가 중요할 때 최적입니다.

  • 파라미터 및 훈련: 파라미터 1.7B; 소형 모델 효율성에 최적화된 Hugging Face 큐레이션 조합으로 훈련됨. 소비자 하드웨어에서의 저지연 추론을 위해 조정됨.
  • 메모리 사용량: Q4_K_M에서 ~1.1 GB. OS를 위한 충분한 여유 공간을 남기며 RAM 6GB 이상 모든 폰에 적합합니다.
  • 속도 (토큰/초): iPhone 17 Pro ~26–32, iPhone 16 Pro ~22–28, Galaxy S25 Ultra ~20–28, iPhone 14 Pro ~15–22. 동일 칩에서 Phi-4 Mini보다 약 2배 빠릅니다.
  • 품질 강점: 빠른 대화 응답, 간단한 Q&A, 자동완성 스타일 지속, 영어 작성.
  • 품질 약점: Phi-4 Mini보다 약한 추론, Llama 3.2 3B보다 제한적인 세계 지식, Qwen 3 1.7B보다 약한 다국어 성능.
  • 최적 용도: 지연 시간이 중요한 중급 폰(텍스트 자동완성, 음성 어시스턴트 턴, 실시간 채팅).
3개 기기에서 Q4_K_M으로 비교한 모바일 LLM 6종의 초당 토큰 수: Gemma 3 1B (~35–45 iPhone 17 Pro)와 SmolLM 2 1.7B (~26–32)가 속도를 리드; Phi-4 Mini (~13–18)와 Gemma 3 4B (~10–13)는 느리지만 더 스마트합니다.
3개 기기에서 Q4_K_M으로 비교한 모바일 LLM 6종의 초당 토큰 수: Gemma 3 1B (~35–45 iPhone 17 Pro)와 SmolLM 2 1.7B (~26–32)가 속도를 리드; Phi-4 Mini (~13–18)와 Gemma 3 4B (~10–13)는 느리지만 더 스마트합니다.

💡Tip: SmolLM 2 1.7B는 모바일 오프라인 음성 어시스턴트에 가장 적합한 조합입니다. 높은 토큰/초는 중급 하드웨어에서도 음성 응답 시간을 ~1.5초 지각 임계값 이하로 유지합니다.

Qwen 3 1.7B: 최고의 모바일 다국어 모델

Qwen 3 1.7B (Alibaba, 2024)는 2026년 최고의 모바일 다국어 모델입니다 — 중국어, 일본어, 한국어, 아랍어, 독일어, 프랑스어, 스페인어, 러시아어를 포함한 35개 이상 언어로 훈련되었습니다. 번역, 영어 외 언어 채팅, 대화 중간에 언어를 전환하는 여행 시 사용에 최적입니다.

  • 파라미터 및 훈련: 파라미터 1.7B; CJK 언어, 아랍어, 주요 유럽 언어가 강력하게 대표되는 Alibaba 다국어 코퍼스로 훈련됨. 다국어 추론에 최적화된 아키텍처.
  • 메모리 사용량: Q4_K_M에서 ~1.1 GB. RAM 6GB 이상 모든 폰에 적합합니다.
  • 속도 (토큰/초): iPhone 17 Pro ~24–32, iPhone 16 Pro ~20–28, Galaxy S25 Ultra ~18–26, iPhone 14 Pro ~14–20. SmolLM 2와 비슷한 속도.
  • 품질 강점: 35개 이상 언어에서 네이티브 수준 출력, 주요 언어 쌍 간 강력한 번역, 일관된 CJK 출력.
  • 품질 약점: 영어만 사용 시 Phi-4 Mini보다 약간 약한 추론, Gemma 3 4B보다 짧은 자연스러운 창작 문체, Llama 3.2 3B보다 약한 도구 호출.
  • 최적 용도: 비영어권 사용자(특히 중국어, 일본어, 독일어, 스페인어, 프랑스어 사용자), 오프라인 번역이 필요한 여행자, 모바일 다국어 기능을 개발하는 개발자.

💡Tip: 특정 두 언어 쌍 간의 번역에서 Qwen 3 1.7B는 번역을 부차 작업으로 실행하는 더 큰 영어 중심 모델을 종종 능가합니다. 한국어로 채팅하는 사용자의 경우 Qwen 3는 60% 더 작음에도 Phi-4 Mini보다 현저히 자연스러운 출력을 생성합니다.

Llama 3.2 3B: 검증된 만능 3B 모델

Llama 3.2 3B (Meta, 2024)는 2026년 가장 검증된 3B 모델입니다 — 더 넓은 앱 호환성, 6종 중 최고의 도구 호출 지원, 가장 큰 커뮤니티 파인튜닝 생태계. 순수 품질에서는 Phi-4 Mini에 약간 뒤지지만 엣지 케이스에서 더 안정적이고 모바일 앱 지원이 더 우수합니다.

  • 파라미터 및 훈련: 파라미터 3B; 채팅 및 도구 사용을 위한 instruction-tuning이 적용된 Meta 대규모 사전훈련 코퍼스로 훈련됨. 8B 및 70B 모델과 같은 Llama 3 아키텍처.
  • 메모리 사용량: Q4_K_M에서 ~2.2 GB, Q5_K_M에서 ~2.8 GB. 8GB 이상 폰에서 편안한 여유 공간을 남기며 구동.
  • 속도 (토큰/초): iPhone 17 Pro ~16–22, iPhone 16 Pro ~12–18, Galaxy S25 Ultra ~12–18, iPhone 14 Pro ~7–11.
  • 품질 강점: 넓은 세계 지식, 강력한 도구 호출 및 함수 호출 지원(4B 미만 모델 중 최고), 안정적인 채팅 동작, 성숙한 파인튜닝 생태계.
  • 품질 약점: Phi-4 Mini보다 약한 chain-of-thought 추론, 비슷한 크기에서 약간 낮은 MMLU 점수, Gemma 3 4B보다 덜 자연스러운 대화 톤.
  • 최적 용도: 도구 호출 또는 함수 호출이 필요한 모바일 앱(로컬 문서에 대한 RAG, 온디바이스 에이전트 워크플로우).

💡Tip: Llama 3.2 3B는 이 그룹에서 온디바이스 에이전트 워크플로우에 충분히 안정적인 도구 호출 지원을 갖춘 유일한 모델입니다. Phi-4 Mini와 SmolLM 2도 기술적으로 도구 호출이 가능하지만 2026년 프로덕션 준비가 된 것은 Llama 3.2 3B뿐입니다.

모바일 양자화: Q4_K_M 표준

Q4_K_M은 2026년 모바일 LLM 추론의 표준 양자화 방식입니다 — 파일 크기를 1/4로 줄이면서 원본 모델 품질의 ~95%를 유지합니다. Q5_K_M이나 Q6_K는 추가 메모리 여유가 실제로 있는 RAM 12GB 이상 폰에서만 사용하십시오.

📍 한 문장으로

Q4_K_M이 모바일 표준입니다 — 크기의 1/4로 품질 ~95% 유지. Q5_K_M / Q6_K는 RAM 12GB 이상 폰에서만 가치 있습니다.

💬 쉽게 말하면

Hugging Face의 모델은 전체 정밀도로 게시됩니다(각 파라미터는 16비트 숫자로 저장됨). 스마트폰에서는 각 파라미터가 4비트로 압축된 양자화 버전을 다운로드합니다 — 파일을 4배 작게 만들고 추론을 약 4배 빠르게 하며 품질 손실은 작습니다. Q4_K_M은 2026년 스마트폰에 올바른 균형으로 합의된 변형입니다. 더 높은 Q 숫자는 압축이 적고 품질이 더 좋지만 파일이 더 큽니다.

  • Q4_K_M (권장 표준): K-퀀트와 혼합 정밀도 "M"을 갖춘 4비트 양자화. 원본 품질의 ~95%. 2026년 모바일 표준. 6종 모두 Hugging Face에서 이 형식으로 제공됩니다.
  • Q5_K_M (RAM 12GB 이상 폰용): 5비트 양자화. 원본 품질의 ~98%. 파일 크기 ~25% 증가. iPhone 17 Pro Max (12 GB) 또는 Galaxy S25 Ultra (12 GB)에서 Phi-4 Mini와 Llama 3.2 3B에 가치 있음.
  • Q6_K (드물게 필요): 6비트 양자화. 원본 품질의 ~99%. 파일 크기 ~50% 증가. 품질의 모든 퍼센트 포인트가 중요한 경우에만 사용.
  • Q8_0 (모바일에서 피할 것): 8비트 양자화. Q4_K_M의 약 2배 크기. 폰에서 RAM 비용이 정당화되지 않음; 데스크톱/노트북용.
  • Q3_K_M / Q2_K (매우 제한된 폰에서만): 품질이 ~85–90%로 떨어집니다. Q4_K_M에서도 Gemma 3 1B가 맞지 않는 경우에만 사용하십시오.
모바일용 GGUF 양자화 수준: Q4_K_M은 6GB 이상 폰의 표준(품질 ~95%, 파일 크기 ×0.5); Q5_K_M과 Q6_K는 12GB 이상에서만; Q8_0은 데스크톱 전용; Q3_K_M은 4GB 폰에서 최후 수단.
모바일용 GGUF 양자화 수준: Q4_K_M은 6GB 이상 폰의 표준(품질 ~95%, 파일 크기 ×0.5); Q5_K_M과 Q6_K는 12GB 이상에서만; Q8_0은 데스크톱 전용; Q3_K_M은 4GB 폰에서 최후 수단.

⚠️Warning: 어느 것이 더 나은지 테스트하기 위해 같은 모델의 여러 양자화 변형을 다운로드하지 마십시오. Q4_K_M과 Q5_K_M의 품질 차이는 실재하지만 작으며, 중복 변형으로 5GB 이상의 공간을 낭비하게 됩니다. Q4_K_M을 선택하고 일주일간 실제 사용 후 필요한 경우에만 업그레이드하십시오.

등급별 판정: 고사양 vs 중급 vs 보급형

폰 등급이 모델 한계를 결정합니다 — 브랜드보다 칩 세대와 RAM이 더 중요합니다. 고사양 폰(RAM 8GB 이상, A18 Pro / A19 Pro / Snapdragon 8 Elite)은 3.8B–4B 모델을 편안하게 실행합니다; 중급(RAM 6–8GB)은 1.7B–3B; 보급형 또는 구형(RAM 4–6GB)은 1B–1.7B를 실행합니다.

📍 한 문장으로

고사양 (8GB 이상) → Phi-4 Mini 3.8B; 중급 (6–8GB) → SmolLM 2 1.7B 또는 Llama 3.2 3B; 보급형 또는 구형 (4–6GB) → Gemma 3 1B 또는 Qwen 3 1.7B.

💬 쉽게 말하면

열망이 아닌 폰에 맞는 모델을 선택하십시오. 6GB 폰에서의 3.8B 모델은 좌절스러운 지연과 강제 종료를 일으킵니다. 고사양 기기에서 1B 모델은 가용 용량을 낭비합니다. OS와 다른 앱 하나가 열린 상태에서 폰이 편안하게 실행할 수 있는 가장 큰 모델을 선택하십시오.

폰 등급예시권장 모델이유
고사양 (8–12 GB RAM)iPhone 17 Pro / Pro Max, iPhone 16 Pro, Galaxy S25 Ultra, OnePlus 13Phi-4 Mini (3.8B Q4_K_M)칩이 실용적인 속도로 지원하는 가장 스마트한 모델
구형 고사양 (8 GB RAM)iPhone 15 Pro, Galaxy S24 Ultra, Pixel 9 ProLlama 3.2 3B 또는 Phi-4 Mini도구 호출에는 Llama 3.2 3B; 순수 품질에는 Phi-4 Mini
중급 (6–8 GB RAM)iPhone 14 Pro, Pixel 9, Snapdragon 8 Gen 2 폰SmolLM 2 1.7B 또는 Qwen 3 1.7B빠른 속도; OS를 위한 여유 공간 확보
보급형 / 구형 (4–6 GB RAM)iPhone 14, Snapdragon 7 시리즈 중급, 구형 AndroidGemma 3 1B 또는 Qwen 3 1.7B일관된 출력을 생성하는 가장 작은 실용 모델
매우 구형 (4 GB RAM)iPhone SE 3세대, 구형 4GB AndroidGemma 3 1B맞는 유일한 모델; 제한적인 추론, 빠른 토큰/초
지원 불가 (4GB 미만)iPhone SE 2세대, 구형 Android홈 PC에 원격 연결온디바이스 LLM은 실용적이지 않음; 홈 Ollama 서버의 인터페이스로 태블릿/폰 사용
등급별 모바일 LLM 권장 사항: 고사양 (8–12 GB RAM) → Phi-4 Mini 3.8B; 구형 고사양 (8 GB) → Llama 3.2 3B; 중급 (6–8 GB) → SmolLM 2 1.7B; 보급형 (4–6 GB) → Qwen 3 1.7B; 매우 구형 (4 GB) → Gemma 3 1B.
등급별 모바일 LLM 권장 사항: 고사양 (8–12 GB RAM) → Phi-4 Mini 3.8B; 구형 고사양 (8 GB) → Llama 3.2 3B; 중급 (6–8 GB) → SmolLM 2 1.7B; 보급형 (4–6 GB) → Qwen 3 1.7B; 매우 구형 (4 GB) → Gemma 3 1B.

💡Tip: 앱 부분에 대해서는 iPhone 및 Android 가이드를 참조하십시오. 앱 가용성이 모델 가용성보다 늦을 때가 있습니다. 앱의 큐레이션 목록에 모델이 없다면 대개 Hugging Face에서 GGUF로 로드할 수 있습니다.

흔한 실수

  • 폰 RAM이 허용하는 것보다 큰 모델 선택. 6GB 폰에서 Phi-4 Mini는 3–5 토큰/초로 구동되며 강제 종료됩니다. 모델을 등급에 맞추십시오.
  • 같은 모델의 여러 양자화 변형 다운로드. Q4_K_M을 선택하고 거기서 멈추십시오. 일상 채팅에서 품질 차이는 인지되지 않습니다.
  • 다단계 추론에 SmolLM 2 1.7B 사용. 가장 빠른 모델이지만 가장 스마트한 모델이 아닙니다. 복잡한 추론에는 Phi-4 Mini를 사용하십시오. 품질 없는 속도는 그냥 더 빠른 오답일 뿐입니다.
  • 다국어 프리픽스 없이 Phi-4 Mini에 다른 언어 출력 요청. CJK나 아랍어에서 불균일한 출력을 생성합니다. 다국어 사용 시 Qwen 3 1.7B를 함께 설치하고 언어에 따라 전환하십시오.
  • 이 모델들에서 클라우드 AI 수준의 품질 기대. 채팅 작업에서 GPT-5.5 용량의 약 60–80%입니다. 잘하는 것(비공개 채팅, 요약, 작성, 번역)에 사용하고 70B 이상이 필요한 것에는 클라우드를 사용하십시오.
  • Phi-4 Mini (3.8B)를 구형 Phi-3 Mini (3.8B)와 혼동. 파라미터 수는 같지만 훈련 데이터와 채팅 템플릿이 다릅니다. GGUF 파일 이름에서 모델 식별자를 항상 확인하십시오.

출처

자주 묻는 질문

iPhone에서 가장 빠른 모바일 모델은 무엇입니까?

Gemma 3 1B는 iPhone 17 Pro에서 ~35–45 토큰/초로 절대적으로 가장 빠릅니다. 1.7B 모델 중에서는 SmolLM 2 1.7B가 ~26–32 토큰/초로 가장 빠릅니다. 고품질 출력을 생성하는 모델 중에서는 Phi-4 Mini가 ~13–18 토큰/초로 가장 빠른 "스마트" 선택입니다.

Gemma 3 2B나 Gemma 3 7B 모델이 있나요?

아니요. Gemma 3는 공식적으로 270M, 1B, 4B, 12B, 27B의 다섯 가지 크기로만 출시되었습니다 — Gemma 3 2B나 Gemma 3 7B는 존재하지 않습니다. 이런 혼동은 보통 Gemma 2에서 비롯되는데, Gemma 2에는 실제로 2B 모델(Google DeepMind, 2024년 7월)이 9B, 27B와 함께 존재했습니다. "Gemma 3 2B"에 가장 가까운 것을 찾는다면, 실제로 존재하는 두 옵션은 Gemma 3 1B(더 작고 빠름)와 Gemma 3 4B(더 크고 똑똑함)이며, 둘 다 이 글에서 벤치마크했습니다. 2026년 4월에는 Google이 Gemma 4도 출시했는데, 다른 크기 라인업(Effective 2B, Effective 4B, 그리고 26B MoE 및 31B dense 변형)을 갖추고 있습니다. Gemma 4는 Gemma 3와는 별개의 모델 계열이며, 이번 업데이트 시점에는 실기기 tokens/sec 검증 수치가 없어 이 모바일 벤치마크에는 아직 포함되지 않았습니다.

이 모델들은 GPU가 필요한가요, 아니면 CPU만으로 동작하나요?

여섯 모델 모두 전용 GPU 없이 동작합니다. iPhone에서는 MLC Chat이 Apple의 Metal API를 사용해 Neural Engine/GPU에서 추론을 가속하지만, PocketPal AI와 LLM Farm(llama.cpp)은 주로 CPU에서 동작합니다. Android에서는 Termux+Ollama가 현재 CPU만으로 동작하며 — 아직 Snapdragon Hexagon NPU를 활용하지 않기 때문에, 동일한 Q4_K_M 파일 기준으로 Android의 tokens/sec가 iPhone보다 약 10~20% 낮습니다(위 비교 표 참고). 실제로 Galaxy S25 Ultra에서 Phi-4 Mini는 CPU만으로 약 10~15 tokens/sec로 동작하며, 이 목록의 어떤 모델도 사용 가능한 출력을 내기 위해 전용 GPU가 필요하지 않습니다.

Phi-4 Mini가 정말 폰에서 7B 모델을 능가합니까?

구형 7B 모델보다는 표준 벤치마크에서 능가합니다. 최신 7B 모델보다는 원시 용량에서 여전히 뒤집니다. Phi-4 Mini가 크기 이상의 성능을 내는 이유는 Microsoft의 훈련 데이터 조합입니다. 폰에서 7B 모델은 어차피 실용적이지 않을 정도로 느리기 때문에 Phi-4 Mini가 기본적으로 승리합니다.

SmolLM 2가 4년 된 폰에서 구동됩니까?

네, 대부분의 4년 된 고사양 폰에서 구동됩니다. Q4_K_M의 SmolLM 2 1.7B는 모델에 ~1.1 GB RAM이 필요합니다 — iPhone 13 (6 GB), iPhone 12 Pro Max (6 GB), 동급 Android (6 GB 이상)에 맞습니다. 2021년 4GB 폰에서는 불안정합니다; 대신 Gemma 3 1B를 사용하십시오.

모바일에서 번역에 가장 적합한 모델은 무엇입니까?

중국어, 일본어, 한국어, 아랍어, 독일어, 프랑스어, 스페인어 또는 러시아어가 포함된 모든 언어 쌍에는 Qwen 3 1.7B. 유럽 언어 쌍만의 경우 Gemma 3 4B가 두 번째 선택입니다. 일회성 번역에는 설치된 번역 앱이 종종 로컬 LLM보다 낫습니다 — 로컬 모델은 같은 대화에서 번역과 채팅을 결합해야 할 때 빛납니다.

잘 사용하려면 고사양 폰이 필요합니까?

아니요, 더 큰 모델에만 해당됩니다. RAM 6–8GB의 중급 폰은 SmolLM 2 1.7B와 Qwen 3 1.7B를 전속력으로 실행합니다(~20–28 토큰/초). RAM 4–6GB의 보급형 폰은 Gemma 3 1B를 ~15–25 토큰/초로 실행합니다.

배터리를 가장 적게 소모하는 모델은 무엇입니까?

Gemma 3 1B가 압도적으로 적습니다. SmolLM 2 1.7B와 Qwen 3 1.7B가 그 뒤를 따릅니다. 3B–4B 모델은 응답당 2–3배 더 많은 에너지를 소비합니다. 배터리가 가장 중요하다면 Gemma 3 1B가 올바른 선택입니다.

모바일 모델이 다회전 대화를 처리할 수 있습니까?

네, 짧은 대화(5–10 턴)에는 가능하며 이후 품질이 저하됩니다. 6종 모두 4,000–8,000 토큰의 컨텍스트 윈도우를 가지고 있습니다. 대부분의 모바일 앱(PocketPal AI, Private LLM)이 대화 요약을 자동으로 수행합니다.

이 모델들이 음성 입력과 함께 작동합니까?

네, Whisper 음성-텍스트 레이어와 결합할 때 작동합니다. 2026년 모바일 오프라인 음성 표준 스택은: Whisper (small 또는 tiny 모델) 음성-텍스트 → Phi-4 Mini 또는 SmolLM 2 응답 생성 → Apple TTS 또는 Android TTS 음성 합성. SmolLM 2 1.7B는 높은 토큰/초로 음성 턴을 ~1.5초 임계값 이하로 유지하기 때문에 음성용 LLM으로 최고 선택입니다.

여행 시 오프라인 사용에 가장 좋은 모델은 무엇입니까?

언어를 전환하고 번역이 필요한 여행에는 Qwen 3 1.7B. 영어 참조가 주로 필요한 여행에는 고사양 폰에서 Phi-4 Mini, 중급 폰에서 SmolLM 2 1.7B. 여행은 로컬 AI의 가장 강력한 사용 사례입니다 — 로밍 데이터가 필요 없고, 클라우드 API 비용이 없습니다.

모바일 모델이 2027년에도 유용하겠습니까?

네, 하지만 특정 모델 이름은 바뀔 것입니다. 소형 LLM의 최전선은 약 6–9개월마다 이동합니다. 카테고리는 구식이 되지 않습니다; 특정 추천이 바뀝니다. 다음 업데이트는 2027-01-14에 확인하십시오.

← 고급 로컬 LLM으로 돌아가기