Skip to main content
PromptQuorum
Home/Local LLMs/소형 로컬 LLM 모델: 2026년 저용량 RAM 기기를 위한 최고의 4B 미만 모델
Best Models

소형 로컬 LLM 모델: 2026년 저용량 RAM 기기를 위한 최고의 4B 미만 모델

·8분 읽기·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

소형 로컬 LLM(1B~4B 파라미터)은 RAM 4~8GB 기기에서 실행되며 CPU에서 초당 30~70 토큰을 생성합니다 -- 실시간 채팅에 충분한 속도입니다.

소형 로컬 LLM(1B~4B 파라미터)은 RAM 4~8GB 기기에서 실행되며 CPU에서 초당 30~70 토큰을 생성합니다 -- 실시간 채팅에 충분한 속도입니다. 2026년 최고의 소형 모델은 Microsoft Phi-4 Mini 3.8B(최고 추론 성능), Google Gemma 4 E2B(가장 빠름), Qwen2.5 3B(최고 코딩 성능), Meta Llama 3.2 3B(최고 범용 성능)입니다.

소형 로컬 LLM 모델: 2026년 저용량 RAM 기기를 위한 최고의 4B 미만 모델

Key Takeaways

  • 소형 규모에서 최고 추론 성능: Phi-4 Mini 3.8B -- MMLU 68%, HumanEval 70%, RAM 4 GB에서 실행 가능.
  • 최고의 소형/엣지 모델: Gemma 4 E2B -- MMLU Pro 60%, 컨텍스트 128K, RAM 약 2 GB, Apache 2.0. 이전 Gemma 2 2B를 대체합니다.
  • 최고 소형 코딩 모델: Qwen2.5 3B -- RAM ~2 GB에서 HumanEval 65%.
  • 최고 범용 3B 모델: Llama 3.2 3B -- 가장 광범위한 커뮤니티 지원, 컨텍스트 128K, RAM 2.5 GB.
  • 2B 미만 모델 중 전문적 작업에 적합한 출력 품질을 생성하는 모델은 없습니다. 실제 업무에는 3B 이상을 사용하십시오.

소형 로컬 LLM(1B-4B 파라미터)은 4-8GB RAM 기기에서 초당 30-70토큰으로 동작하며, 추론에서는 Phi-4 Mini 3.8B가 앞서고, 128K 컨텍스트를 지원하는 소형/엣지 기기에는 Gemma 4 E2B, 코딩에는 Qwen2.5 3B, 범용에는 Llama 3.2 3B가 가장 적합합니다.

노트북에 RAM이 4-8GB밖에 없어도 AI 모델을 실행할 수 있습니다 -- 다만 더 작은 모델이어야 합니다. 이 4B 미만 모델들은 실시간 채팅에 충분히 빠르며, 요약, 간단한 질의응답, 짧은 텍스트 번역 같은 간단한 작업은 잘 처리하지만, 여러 단계에 걸친 추론이나 길고 일관된 문서 작성에는 약합니다. 그래도 대부분의 작업에는 입문용 하드웨어에 잘 맞는 선택입니다.

"소형" 로컬 LLM이란 무엇이며 언제 사용해야 합니까?

소형 로컬 LLM은 일반적으로 40억 개 미만의 파라미터를 가진 모델로 정의됩니다. Q4_K_M 양자화에서 이러한 모델은 1.5~3 GB의 RAM을 필요로 합니다 -- RAM 4~8 GB의 보급형 노트북 제약 조건 내에서 충분히 실행 가능합니다.

소형 모델은 빠른 요약, 간단한 Q&A, 코드 스니펫 설명, 짧은 텍스트 번역, 분류 작업에 적합합니다. 다단계 추론, 복잡한 코드 생성, 장문의 일관된 문서 작성에는 적합하지 않습니다.

3B 모델과 7B 모델 간의 품질 차이는 상당합니다 -- GPT-4o mini와 GPT-5.5 간의 차이에 거의 해당합니다. RAM 8 GB 사용자의 경우, 기기에 여유가 있다면 Q4_K_M의 7B 모델이 거의 항상 더 나은 선택입니다. 7B 모델 추천은 초보자를 위한 최고 로컬 LLM 모델을 참조하십시오.

어떤 모델을 사용해야 합니까? 빠른 선택 가이드

결정 트리: 우선순위(추론, 속도, 코딩)에 따라 선택하십시오. 확실하지 않다면 Llama 3.2 3B를 기본으로 사용하십시오.
결정 트리: 우선순위(추론, 속도, 코딩)에 따라 선택하십시오. 확실하지 않다면 Llama 3.2 3B를 기본으로 사용하십시오.

Phi-4 Mini 3.8B -- 4B 미만 클래스에서 최고 추론 성능

Microsoft Phi-4 Mini는 MMLU 68%와 HumanEval 70%를 달성합니다 -- 2025년 이전에 출시된 많은 7B 모델을 능가하는 점수입니다. 이는 Phi-4 Mini가 광범위한 웹 텍스트가 아닌 추론과 문제 해결에 초점을 맞춘 정제된 합성 데이터셋으로 학습되었기 때문에 가능합니다.

Phi-4 Mini는 RAM 4~6 GB 하드웨어에서 주로 추론(수학, 논리, 단계별 설명)이나 코딩 지원이 필요한 사용자에게 권장되는 선택입니다.

Spec
Value
MMLU68%
HumanEval70%
RAM (Q4_K_M)~2.5 GB
컨텍스트128K 토큰
CPU 속도초당 30~50 토큰
Ollama 명령어ollama run phi4-mini

Gemma 4 E2B -- 최고의 소형/엣지 모델

Google Gemma 4 E2B는 현세대 소형 모델로, 이전 세대 Gemma 2 2B를 대체합니다. Google 공식 모델 카드에 따르면 MMLU Pro(기존 MMLU보다 어려운 벤치마크)에서 60%, LiveCodeBench v6에서 44%, GPQA Diamond에서 43.4%를 기록했습니다. 유효 파라미터는 2.3B(임베딩 포함 5.1B)이며 약 2 GB RAM에 들어갑니다.

128K 컨텍스트 창은 이전 Gemma 2 2B의 8K에서 크게 향상된 것으로, 이제 Phi-4 Mini 및 Llama 3.2 3B와 동등한 수준입니다. CPU 속도는 하드웨어와 양자화에 따라 다릅니다(Google은 Raspberry Pi 5에서 디코딩 약 7.6토큰/초를 보고했으며, 독립적인 x86 CPU 보고서는 8~48토큰/초 범위를 나타냅니다) -- 사용 중인 기기의 최신 수치를 확인하십시오. Apache 2.0 라이선스.

Spec
Value
MMLU Pro60%
LiveCodeBench v644%
GPQA Diamond43.4%
RAM (Q4_K_M)~2 GB
컨텍스트128K 토큰
Ollama 명령어ollama pull gemma4:e2b

Qwen2.5 3B -- 코딩 작업에 최적인 소형 모델

Qwen2.5 3B는 HumanEval에서 65%를 기록합니다 -- Llama 3.2 3B보다 5퍼센트포인트 높아 3B 규모에서 코딩 작업에 최적의 선택입니다. JSON 모드와 함수 호출 지원을 포함하며, 29개 언어를 기본으로 처리합니다.

영어 비코딩 작업에서는 Llama 3.2 3B와 Phi-4 Mini가 더 자연스러운 산문을 생성합니다. 코딩이나 다국어 출력이 주요 사용 사례인 경우에만 Qwen2.5 3B를 선택하십시오.

Spec
Value
MMLU62%
HumanEval65%
RAM (Q4_K_M)~2 GB
컨텍스트128K 토큰
CPU 속도초당 25~40 토큰
Ollama 명령어ollama run qwen2.5:3b

Llama 3.2 3B -- 최고 범용 소형 모델

Meta Llama 3.2 3B는 가장 광범위하게 문서화되고 커뮤니티에서 지원되는 3B 모델입니다. MMLU 58%와 HumanEval 60%를 기록합니다 -- 두 항목 모두 Phi-4 Mini보다 약간 낮지만 -- 가장 넓은 도구 지원, 가장 많은 파인튜닝 모델, 가장 방대한 커뮤니티 가이드 컬렉션을 갖추고 있습니다.

128K 컨텍스트 창은 더 큰 Llama 3.x 모델과 동일하여 중간 길이의 문서 요약에 적합합니다. 첫 번째 소형 모델로는 예측 가능한 동작과 방대한 문서로 인해 Llama 3.2 3B가 가장 안전한 선택입니다.

Spec
Value
MMLU58%
RAM (Q4_K_M)~2.5 GB
컨텍스트128K 토큰
CPU 속도초당 25~45 토큰
Ollama 명령어ollama run llama3.2:3b

Llama 3.2 1B -- 유용한 출력을 위한 절대 최소 사양

Llama 3.2 1B는 Meta가 공개한 가장 작은 Llama 모델로, RAM 1.3 GB만 필요하며 CPU에서 초당 60~90 토큰을 생성합니다 -- 이 페이지에서 로컬로 실행 가능한 가장 빠른 모델입니다. 출력 품질은 한계 수준입니다: 매우 간단한 분류와 키워드 추출은 처리하지만 일관성 있는 여러 문장 응답에는 어려움을 겪습니다. Llama 3.2 1B는 RAM이 실제로 제약 요인인 경우(가용 RAM 3 GB 미만)나 도구 통합 테스트 목적으로만 사용하십시오.

전체 비교: 4B 미만 최고 소형 로컬 LLM

모델
MMLU
HumanEval
RAM
컨텍스트
최적 용도
Phi-4 Mini 3.8B68%70%2.5 GB128K추론, 코딩
Qwen2.5 3B62%65%2 GB128K코딩, 다국어
Llama 3.2 3B58%60%2.5 GB128K범용, 첫 모델
Gemma 4 E2B2 GB128K엣지 (MMLU Pro 60%)
Llama 3.2 1B32%28%1.3 GB128K절대 최소 RAM
성능 등급: Phi-4 Mini는 추론과 코딩에서 선두이고, Gemma 4 E2B는 가장 작은 RAM 사용량으로 컨텍스트 길이(128K)에서 앞서며, Qwen2.5는 코딩에서 탁월합니다.
성능 등급: Phi-4 Mini는 추론과 코딩에서 선두이고, Gemma 4 E2B는 가장 작은 RAM 사용량으로 컨텍스트 길이(128K)에서 앞서며, Qwen2.5는 코딩에서 탁월합니다.

지역별 소형 로컬 LLM

EU / GDPR: 제약된 하드웨어 -- 현장 작업, 에어갭 환경, 구형 기업 노트북 -- 에서 AI를 실행하는 EU 전문가의 경우, 소형 로컬 모델은 데이터 외부 유출 없이 GDPR 준수 추론을 제공합니다. 표준 기업 노트북(RAM 8 GB)에서 실행되는 Phi-4 Mini 3.8B는 GDPR 제5조(데이터 최소화) 하에 처리된 모든 텍스트를 온디바이스에 보관합니다. 독일 BSI 준수 문서화의 경우: Phi-4 Mini(Microsoft, MIT 라이선스)와 Llama 3.2 3B(Meta, Llama Community 라이선스) 모두 Ollama 태그를 통해 버전이 지정된 모델 식별자를 제공하여 AI 도구 문서화 요건을 충족합니다. Mistral은 현재 4B 미만 모델을 제공하지 않습니다. 이 크기 클래스에서 EU 출신 모델을 선호하는 EU 조직의 경우, Mistral이 4B 미만 버전을 출시할 때까지 선택지가 제한적입니다.

일본 (METI): 소형 모델 등급에서 일본어 작업의 경우, Qwen2.5 3B가 이 비교에서 기본 일본어 토크나이제이션을 갖춘 유일한 모델입니다. Llama 3.2 3B는 일본어를 처리하지만 토큰 효율이 낮습니다. 제약된 하드웨어에서 일본어 요약이나 번역의 경우: `ollama run qwen2.5:3b`. 소형 모델의 속도 이점은 일본 기업 사용에 특히 관련성이 있습니다: CPU에서 초당 25~40 토큰은 표준 사무용 하드웨어의 채팅 인터페이스에 적절한 실시간 응답을 제공합니다.

중국: Qwen2.5 3B(알리바바, Apache 2.0)는 중국어 소형 모델 배포의 자연스러운 선택입니다. 기본 중국어 토크나이제이션은 동등한 파라미터 수에서 Llama보다 중국어 텍스트를 30~40% 더 효율적으로 처리합니다. 중국의 데이터 안전법(数据安全法) 하에서 IoT 및 엣지 배포의 경우: `ollama run qwen2.5:3b`는 RAM 4 GB의 모든 Linux 기기에서 실행되며 외부 API 호출 없이 온디바이스로 모든 텍스트를 처리합니다.

소형 로컬 LLM 실행 시 흔한 실수는 무엇입니까?

  • Q4_K_M 대신 Q8_0 양자화 사용: Q8_0은 소형 모델에서 품질 개선이 미미함에도 Q4_K_M 대비 거의 두 배의 RAM을 필요로 합니다. Q8_0의 Llama 3.2 3B 모델은 Q4_K_M의 ~2.5 GB 대비 ~3.8 GB의 RAM이 필요합니다. RAM 4 GB 기기에서 Q8_0은 스왑 사용을 유발하여 추론 속도를 3~5배 느리게 만들 수 있습니다. 4B 미만 모델에는 항상 Q4_K_M을 기본값으로 사용하십시오.
  • instruct 버전 대신 베이스 모델 실행: 베이스 모델(예: `llama3.2:3b-text`)은 파인튜닝 이전의 체크포인트로, 텍스트의 다음 토큰을 예측하도록 학습된 모델입니다. 이 모델은 지시를 따르지 않습니다. 베이스 모델에 "2+2는 무엇입니까?"라고 물으면 "4"라고 답하는 대신 퀴즈 형식으로 문장을 완성할 수 있습니다. 항상 instruct 버전을 사용하십시오: `llama3.2:3b` (Ollama는 이름이 지정된 모델에 대해 기본적으로 instruct를 사용합니다).
  • 3B 모델에 7B 모델 수준의 품질 기대: MMLU 68%의 3B 모델(Phi-4 Mini)은 일반 작업에서 2023년 GPT-3.5 Mini와 유사한 성능을 보입니다. 복잡한 추론 연쇄, 장문 작성, 세밀한 코드 생성은 7B 모델보다 눈에 띄게 낮은 품질을 보일 것입니다. 출력 품질이 충분하지 않다면 7B 모델로 업그레이드하십시오 -- RAM 차이는 약 2 GB(2.5 GB → 4.5 GB)입니다.

양자화 이해: RAM 대 품질 트레이드오프

양자화 트레이드오프: Q4_K_M(2.5 GB, 품질 -0.5%)이 권장 기본값입니다. Q8_0은 품질 향상 없이 3.8 GB를 사용합니다. 극도로 RAM이 제한된 경우 Q3_K_M(1.8 GB, 품질 손실 -1.8%)을 고려하십시오.
양자화 트레이드오프: Q4_K_M(2.5 GB, 품질 -0.5%)이 권장 기본값입니다. Q8_0은 품질 향상 없이 3.8 GB를 사용합니다. 극도로 RAM이 제한된 경우 Q3_K_M(1.8 GB, 품질 손실 -1.8%)을 고려하십시오.

소형 로컬 LLM 모델에 대한 일반적인 질문

유용한 출력을 생성하는 가장 작은 로컬 LLM은 무엇입니까?

유용한 출력을 위한 실질적인 최소 사양은 Q4_K_M 양자화의 3B 모델입니다. 2B 미만 파라미터 모델(Llama 3.2 1B, Gemma 4 E2B)은 일관성 있는 단일 문장을 생성하지만 다단계 지시, 긴 응답, 복잡한 추론에 어려움을 겪습니다. 요약이나 간단한 Q&A와 같은 작업에는 Gemma 4 E2B가 사용 가능합니다. 더 복잡한 작업에는 3B 모델부터 시작하십시오.

3B 모델을 스마트폰에서 실행할 수 있습니까?

예 -- Llama 3.2 1B와 3B는 온디바이스 모바일 배포를 위해 특별히 설계되었습니다. Meta는 iOS(MLC LLM 경유)와 Android용 최적화 빌드를 제공합니다. 최신 스마트폰(Snapdragon 8 Gen 3 또는 Apple A17 Pro)에서의 추론은 1B 모델 기준 초당 15~30 토큰을 생성합니다. LM Studio와 Ollama는 현재 iOS 및 Android에서 실행되지 않으며, 모바일에는 별도의 프레임워크가 필요합니다.

소형 모델은 요약 작업에 적합합니까?

예 -- 요약은 소형 모델의 가장 강력한 사용 사례 중 하나입니다. Gemma 4 E2B와 Llama 3.2 3B는 약 4,000단어까지의 텍스트 요약을(품질 출력의 실질적 컨텍스트 한계) 안정적으로 생성합니다. 더 긴 문서의 경우 Phi-4 Mini나 Llama 3.2 3B(둘 다 128K 토큰)와 같이 큰 컨텍스트 창을 가진 모델을 사용하십시오.

동일한 하드웨어에서 2B 모델은 7B 모델보다 얼마나 빠릅니까?

하드웨어와 양자화에 따라 크게 달라집니다 -- Google은 Raspberry Pi 5에서 Gemma 4 E2B의 디코딩 속도를 초당 약 7.6토큰으로 보고했으며, 독립적인 x86 CPU 테스트에서는 초당 8~48토큰 범위를 보입니다. GPU에서는 GPU 처리량이 모델 크기에 덜 제약받기 때문에 속도 이점이 줄어듭니다. 속도 차이는 CPU 전용 기기에서 가장 두드러집니다.

소형 모델은 함수 호출을 지원합니까?

일부 모델은 지원합니다. Qwen2.5 3B는 함수 호출과 JSON 모드를 지원합니다. Llama 3.2 3B는 기본적인 도구 사용을 지원합니다. Gemma 4 E2B는 함수 호출을 지원하지 않습니다. 구조화된 출력에 의존하는 파이프라인을 구축하기 전에 모델 문서를 확인하십시오.

영어 외 언어에 가장 적합한 소형 모델은 무엇입니까?

Qwen2.5 3B는 중국어, 일본어, 한국어, 아랍어를 포함하여 29개 언어를 기본으로 지원합니다. Gemma 4 E2B와 Phi-4 Mini는 주로 영어에 최적화되어 있습니다. 소형 모델 규모에서 비영어 작업에는 Qwen2.5 3B가 명확한 선택입니다. 전체 언어 비교는 Qwen vs Llama vs Mistral 다국어 비교를 참조하십시오.

일상적인 작업에서 Phi-4 Mini와 Llama 3.2 3B의 차이는 무엇입니까?

Phi-4 Mini는 거의 동일한 RAM(각 2.5 GB)으로 추론, 수학, 코딩에서 Llama 3.2 3B를 능가합니다(MMLU 68% 대 58%, HumanEval 70% 대 60%). Q&A, 요약, 간단한 설명 등 일상적인 작업에서는 품질 차이가 눈에 띄지만 극적이지는 않습니다. Llama 3.2 3B는 더 넓은 커뮤니티 지원과 더 많은 파인튜닝 모델을 갖추고 있습니다. 구조화된 추론에는 Phi-4 Mini를, 일반 채팅과 광범위한 호환성에는 Llama 3.2 3B를 선택하십시오.

두 개의 소형 모델을 동시에 실행할 수 있습니까?

예, 총 RAM이 허용하는 경우 가능합니다. Q4_K_M의 3B 모델 두 개는 합쳐서 ~5 GB를 사용합니다 -- 경량 OS를 갖춘 8 GB 기기에서 실행 가능합니다. Ollama는 기본적으로 프로세스당 한 번에 하나의 모델을 로드합니다. 두 개의 Ollama 인스턴스를 다른 포트에서 실행하여(OLLAMA_HOST=:11434 및 OLLAMA_HOST=:11435) 두 모델을 병렬로 제공할 수 있습니다. 이는 출력 A/B 테스트에 유용합니다.

소형 모델은 RAG(검색 증강 생성)에 적합합니까?

간단한 RAG에는 적합합니다. Llama 3.2 3B와 Phi-4 Mini는 검색된 문서 청크에 대한 질문에 안정적으로 답변할 수 있습니다. 멀티홉 추론이 필요한 대규모 지식 베이스에 대한 RAG의 경우 7B 이상 모델이 더 일관성 있게 성능을 발휘합니다. GPT4All의 LocalDocs 기능은 문서 Q&A에 3B 모델을 사용하며 개인 문서 컬렉션에 잘 작동합니다.

코딩에서 Phi-4 Mini가 Llama 3.2 3B보다 우수합니까?

예. Phi-4 Mini는 HumanEval에서 70%를 기록하는 반면 Llama 3.2 3B는 60%입니다 -- 이 규모에서 의미 있는 10포인트 차이입니다. RAM 4~6 GB 기기에서 코딩 지원에는 Phi-4 Mini가 권장됩니다. 다국어 코딩(Python 외)의 경우 HumanEval 65%의 Qwen2.5 3B가 함수 호출도 지원하면서 Phi-4 Mini와 경쟁력 있는 성능을 보입니다.

Q4_K_M 대신 Q8_0 양자화를 사용하는 경우

Q8_0은 소형 모델에서 품질 개선이 미미함에도 Q4_K_M 대비 거의 두 배의 RAM을 필요로 합니다. Q8_0의 Llama 3.2 3B 모델은 Q4_K_M의 ~2.5 GB 대비 ~3.8 GB의 RAM이 필요합니다. RAM 4 GB 기기에서 Q8_0은 스왑 사용을 유발하여 추론 속도를 3~5배 느리게 만들 수 있습니다. 4B 미만 모델에는 항상 Q4_K_M을 기본값으로 사용하십시오.

instruct 버전 대신 베이스 모델을 실행하는 경우

베이스 모델(예: llama3.2:3b-text)은 파인튜닝 이전의 체크포인트로, 텍스트의 다음 토큰을 예측하도록 학습된 모델입니다. 이 모델은 지시를 따르지 않습니다. 베이스 모델에 "2+2는 무엇입니까?"라고 물으면 "4"라고 답하는 대신 퀴즈 형식으로 문장을 완성할 수 있습니다. 항상 instruct 버전을 사용하십시오: llama3.2:3b (Ollama는 이름이 지정된 모델에 대해 기본적으로 instruct를 사용합니다).

3B 모델에 7B 모델 수준의 품질을 기대하는 경우

MMLU 68%의 3B 모델(Phi-4 Mini)은 일반 작업에서 2023년 GPT-3.5 Mini와 유사한 성능을 보입니다. 복잡한 추론 연쇄, 장문 작성, 세밀한 코드 생성은 7B 모델보다 눈에 띄게 낮은 품질을 보일 것입니다. 출력 품질이 충분하지 않다면 7B 모델로 업그레이드하십시오 -- RAM 차이는 약 2 GB(2.5 GB → 4.5 GB)입니다.

실제로 사용 가능한 가장 작은 로컬 LLM은 무엇입니까?

일관된 출력을 위한 최소 기준은 약 1B 파라미터이며, 이 목록에서 실제 작업에 사용할 가치가 있는 가장 작은 모델은 Llama 3.2 1B입니다. 그 이하의 초소형 모델은 거의 모든 하드웨어에서 로드되고 텍스트를 생성하지만, 몇 문장이 지나면 일관성이 무너지므로 어시스턴트보다는 자동 완성 기능으로 취급하는 것이 적절합니다. 품질보다 디스크와 RAM이 제약 조건이라면, 작은 용량으로 실용적인 가장 작은 로컬 LLM은 Q4 양자화의 sub-2B 모델입니다. 4GB 이상 여유가 있다면 4B 모델이 아주 적은 추가 RAM으로 일관성을 크게 향상시킵니다.

로컬에서 실행할 수 있는 가장 작은 LLM 모델은 무엇입니까?

Llama 3.2 1B는 Meta가 공개한 가장 작은 Llama 모델이자 이 비교에서 가장 실용적인 선택입니다 -- RAM 1.3 GB만 필요하며 CPU에서 초당 60~90 토큰으로 동작하여 이 페이지의 다른 어떤 모델보다 빠릅니다. 짧은 분류 및 키워드 추출 작업은 처리하지만, 더 길고 여러 단계로 이루어진 출력에서는 한계를 보입니다. 일상적으로 실제로 사용할 수 있는 소형 모델(미니 LLM이라고도 불립니다)을 원한다면, Llama 3.2 1B를 품질의 하한이 아니라 하드웨어의 하한으로 취급하십시오 -- 실제 작업에는 Gemma 4 E2B나 Qwen2.5 3B, Llama 3.2 3B 같은 3B 모델로 단계를 올리십시오.

출처

  • Hugging Face Open LLM Leaderboard -- open-llm-leaderboard.hf.space (MMLU 및 HumanEval 점수)
  • Microsoft Phi-4 기술 보고서 -- microsoft.com/en-us/research/publication/phi-4-technical-report/
  • Meta Llama 3.2 모델 카드 -- huggingface.co/meta-llama/Llama-3.2-3B-Instruct
  • Google Gemma 4 모델 카드 -- huggingface.co/google/gemma-4-e2b-it

A Note on Third-Party Facts

This article references third-party AI models, benchmarks, prices, and licenses. The AI landscape changes rapidly. Benchmark scores, license terms, model names, and API prices can shift between the time of writing and the time you read this. Before making deployment or compliance decisions based on this article, verify current figures on each provider’s official source: Hugging Face model cards for licenses and benchmarks, provider websites for API pricing, and EUR-Lex for current GDPR and EU AI Act text.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Download the PromptQuorum Beta →

← Back to Local LLMs