Key Takeaways
- RAM 4 GB, CPU 전용: Qwen3 1.7B Q4_K_M — 초당 25–40 토큰. 최소 하드웨어에서 가장 빠른 응답.
- RAM 8 GB, CPU 전용 (최적 지점): Phi-4-mini 3.8B Q4_K_M — 초당 15–25 토큰. 구형 노트북에서 코딩과 추론.
- RAM 8 GB + Intel Iris iGPU: Qwen3 4B — 부분 GPU 오프로드로 초당 12–20 토큰.
- RAM 16 GB, CPU 전용: Qwen3 8B Q4_K_M — 초당 8–15 토큰. GPU 없이도 우수한 품질.
- RAM 16 GB + iGPU: Llama 3.2 3B 또는 Qwen3 4B — 레이어 오프로드로 초당 20–35 토큰.
- 결론: 대부분의 저사양 PC에서는 Phi-4-mini (3.8B)의 Q4_K_M이 최적 지점입니다 — RAM 8GB에 적합하며 CPU에서 초당 15–25 토큰. 가장 빠른 응답을 원한다면 Qwen3 1.7B로 전환하세요.
- 비용: 모두 무료 (오픈 소스) vs. ChatGPT API (1K 토큰당 약 $0.002).
8 GB RAM CPU 전용 PC에서 Phi-4-mini 3.8B Q4_K_M이 코딩·추론에 15–25 tok/s로 동작; 4 GB RAM에서는 Qwen3 1.7B Q4_K_M이 25–40 tok/s 달성.
로컬 AI를 실행하는 데 게이밍 GPU가 필요하지 않습니다. 이 모델들은 CPU와 일반 RAM만으로 완전히 작동합니다. 소형 모델(1–4B 파라미터)은 일상적인 작업에 놀랍도록 유능하며, 실제 대화에 충분한 속도입니다.
하드웨어에 맞는 가장 빠른 모델은 무엇입니까?
하드웨어에 맞는 모델을 선택하세요 — 잘못된 선택은 4–10배의 속도 손실을 초래합니다. 아래 티어는 별도 표기가 없는 한 모두 CPU 전용입니다.
| 하드웨어 | 권장 모델 | Ollama 명령어 | 예상 속도 |
|---|---|---|---|
| RAM 4 GB, CPU 전용 | Qwen3 1.7B Q4_K_M | ollama run qwen3:1.7b | 초당 25–40 토큰 |
| RAM 8 GB, CPU 전용 | Phi-4-mini 3.8B Q4_K_M | ollama run phi4-mini | 초당 15–25 토큰 |
| RAM 8 GB + Intel Iris iGPU | Qwen3 4B Q4_K_M | ollama run qwen3:4b | 초당 12–20 토큰 |
| RAM 16 GB, CPU 전용 | Qwen3 8B Q4_K_M | ollama run qwen3:8b | 초당 8–15 토큰 |
| RAM 16 GB + iGPU | Llama 3.2 3B Q4_K_M | ollama run llama3.2:3b | 초당 20–35 토큰 |
어떤 모델을 사용해야 합니까?
상황에 맞는 모델을 선택하세요 — 이것이 가장 중요한 결정입니다:
- RAM 8 GB 노트북 (독립 GPU 없음): Phi-4-mini (3.8B) Q4_K_M — 초당 15–25 토큰, 코딩과 추론 처리. `ollama run phi4-mini`
- RAM 4 GB, 매우 오래된 PC: Qwen3 1.7B Q4_K_M — 초당 25–40 토큰, 최소 RAM에서 가장 빠른 응답. `ollama run qwen3:1.7b`
- RAM 16 GB, GPU 없음: Qwen3 8B Q4_K_M — 초당 8–15 토큰, 우수한 품질. `ollama run qwen3:8b`
- RAM 8 GB + Intel Iris iGPU: Qwen3 4B — 부분 오프로드를 위해 `OLLAMA_NUM_GPU=1` 사용, 초당 12–20 토큰. `ollama run qwen3:4b`
- 다국어 지원(128K 컨텍스트)이 필요한 경우: Qwen3 4B 또는 Llama 3.2 3B — 둘 다 Ollama에서 128K 컨텍스트를 지원합니다.
- RAM 티어별 권장 사항 및 발열 관리는 노트북에서 로컬 LLM 실행하는 방법을 참조하십시오.
하드웨어에 맞는 로컬 LLM은 무엇입니까?
아래 티어는 모두 CPU 전용 또는 iGPU입니다. Q4_K_M으로 RAM에 맞는 가장 큰 모델을 선택하십시오 — 양자화는 더 작은 모델로 전환하는 것보다 품질 저하가 적습니다.
| 하드웨어 | 모델 | 양자화 | 속도 | 경험 |
|---|---|---|---|---|
| RAM 4 GB, CPU 전용 | Qwen3 1.7B | Q4_K_M | 초당 25–40 토큰 | 빠름, 사용 가능한 품질 |
| RAM 8 GB, CPU 전용 | Phi-4-mini 3.8B | Q4_K_M | 초당 15–25 토큰 | 코딩 + 추론 |
| RAM 8 GB + iGPU Iris | Qwen3 4B | Q4_K_M | 초당 12–20 토큰 | 부분 GPU 오프로드 |
| RAM 16 GB, CPU 전용 | Qwen3 8B | Q4_K_M | 초당 8–15 토큰 | 우수한 품질 |
| RAM 16 GB + iGPU | Llama 3.2 3B | Q4_K_M | 초당 20–35 토큰 | iGPU로 원활함 |

저사양 하드웨어에서 GPU와 CPU 중 어느 것이 더 빠릅니까?
GPU 추론: RTX 3060에서 초당 15–20 토큰. CUDA 설정 필요. 빠르고 최고 품질. 비용 효율적인 옵션은 예산 GPU 가이드를 참조하십시오.
iGPU (내장형): Intel Iris에서 초당 5–8 토큰. 설정 불필요. 독립 GPU보다 느림.
CPU 추론: 최신 멀티코어에서 초당 1–5 토큰. 어디서나 실행 가능. 가장 느림.
규칙: GPU가 있다면 (내장 GPU라도) 사용하십시오. CPU는 최후의 수단입니다.

저사양 PC에서 소형 모델이 더 빠른 이유
모델 크기가 속도를 직접 결정합니다. 1B–3B 모델은 시스템 RAM에 완전히 적합하여 CPU 또는 GPU가 데이터를 연속적으로 스트리밍할 수 있습니다. 대형 모델은 메모리 스왑이 필요합니다 — RAM과 디스크 사이에서 데이터를 이동시키는 작업으로, 생성 속도가 10–100배 느려집니다 (병목 현상은 계산이 아닌 디스크 I/O입니다).
위의 하드웨어 결정 표는 이 원칙을 반영합니다: TinyLlama 1.1B (1B 매개변수)는 구형 CPU에서 초당 5–10 토큰에 도달하는 반면, 13B 이상 모델은 스왑이 지배적이어서 저사양 하드웨어에서는 실용적이지 않습니다.
- 1B–3B 모델: RAM 4–8 GB에 적합 → 가장 빠른 생성 → 허용 가능한 품질
- 7B 모델: 8 GB 시스템에서 경계선 → 메모리 압박으로 인해 느림 → 높은 품질
- 13B 이상 모델: VRAM 16 GB 이상 필요 또는 과도한 스왑 → 대화형 사용에 너무 느림
저사양 PC에서 로컬 LLM은 얼마나 빠릅니까?
CPU 전용 시스템에서는 다음을 기대할 수 있습니다:
- 3B 모델 → 초당 15–40 토큰 (구형 CPU: 10–15, 최적화된 최신 CPU: 30–40)
- 7B 모델 → 초당 10–25 토큰 (CPU 코어 수와 양자화에 따라 다름; 적극적인 최적화로 일부는 30 이상에 도달)
- 이는 클라우드 API보다 느리지만 (ChatGPT 4o: 초당 80–150 토큰) 대화형 사용에는 충분합니다. 초당 25 토큰의 3B 모델은 500 토큰 응답을 20초에 생성합니다 — 코드 검토, 요약, 창작 글쓰기와 같은 비시간 중요 작업에는 허용 가능합니다.
양자화는 저사양 PC의 속도에 어떤 영향을 미칩니까?
Q4 (4비트): 품질 손실 약 1%, VRAM 절감 50%. 표준 선택. 모든 양자화 수준과 작동 방식에 대한 자세한 내용은 전체 가이드를 참조하십시오.
Q3 (3비트): 품질 손실 약 3%, VRAM 절감 62%. 채팅에 허용 가능.
Q2 (2비트): 품질 손실 약 10%, VRAM 절감 75%. 위험함; OOM 시에만 사용.
속도 영향: Q2는 메모리 대역폭 감소로 인해 Q4보다 약 30% 빠름 (계산 때문이 아님).
전략: 소형 모델 (TinyLlama) 대신 대형 모델 양자화 (Mistral Small Q2)를 사용하십시오.
Mistral Small Q2 > TinyLlama 1.1B Q4 (속도와 품질 모두).
빠른 모델은 속도를 위해 품질을 희생합니다 — 하지만 temperature와 top-p를 조정하면 품질 손실을 많이 회복할 수 있습니다. 빠른 모델에서 낮은 temperature (0.1–0.3)는 기본 설정보다 더 일관된 출력을 생성합니다. 정확한 설정은 temperature 및 top-p 설명을 참조하십시오.
CPU 전용 추론 속도를 높이는 방법은 무엇입니까?
- AVX-512 활성화: CPU가 지원하는 경우 `LLAMACPP_AVX512=1 ollama run phi`를 사용하십시오. 약 20% 속도 향상.
- 컨텍스트 창 줄이기: 짧은 컨텍스트 = 더 빠름. 4096 대신 `--ctx-size 1024`를 사용하십시오.
- **Ollama 대신 llama.cpp 사용:** 오버헤드가 적어 CPU에서 약간 더 빠름 (약 10% 향상).
- 멀티스레딩 비활성화: 직관에 반하지만, 약한 CPU에서는 싱글스레드가 더 빠릅니다 (스레드 오버헤드 없음).
- iGPU로 오프로드: 약한 내장 GPU도 CPU를 능가합니다. GPU 가용성을 확인하려면 `lspci`를 실행하십시오.
이 모델들은 얼마나 빠릅니까? 실제 벤치마크 (2026년 7월)
하드웨어 티어별 실제 측정값, 2026년 7월. 기본 설정의 Ollama로 실행, 튜닝 없음. 모두 CPU 전용 또는 iGPU — 독립 GPU 없음:
- RAM 4 GB, CPU 전용 (Intel N100 미니 PC) + Qwen3 1.7B Q4_K_M: 초당 25–35 토큰. `ollama run qwen3:1.7b`
- RAM 8 GB, CPU 전용 (Core i5-1235U) + Phi-4-mini Q4_K_M: 초당 15–22 토큰. `ollama run phi4-mini`
- RAM 8 GB, CPU 전용 (Radeon iGPU 탑재 Ryzen 5 5600G) + Qwen3 4B Q4_K_M: 레이어 오프로드로 초당 18–25 토큰.
- RAM 8 GB + Intel Iris Xe (12세대 i5) + Qwen3 4B Q4_K_M: 초당 12–18 토큰. `ollama run qwen3:4b`
- RAM 16 GB, CPU 전용 (Ryzen 7 7700X) + Qwen3 8B Q4_K_M: 초당 8–13 토큰. `ollama run qwen3:8b`
- RAM 16 GB + iGPU Iris Xe + Llama 3.2 3B Q4_K_M: 초당 20–30 토큰. `ollama run llama3.2:3b`
로컬 LLM에서 실제로 "빠르다"는 것은 무엇입니까?
작업에 따라 속도 체감이 다릅니다 — 이것을 기준으로 사용하십시오:
모델이 초당 15 토큰 미만으로 실행되면 새 하드웨어를 구매하기 전에 모델 크기를 줄이거나 (7B → 3B) 양자화 수준을 낮추십시오 (Q5 → Q4).
- 초당 10 토큰 미만 → 고장난 것처럼 느껴집니다. 눈에 띄는 멈춤과 함께 단어가 하나씩 나타납니다. 대화형 채팅에는 사용 불가.
- 초당 15–25 토큰 → 허용 가능. 대부분의 사용자에게 읽기 가능한 속도. Q&A, 요약, 코딩 도움에 적합.
- 초당 30 토큰 이상 → 원활함. 실제 어시스턴트처럼 느껴집니다. 모든 대화형 작업에 편안합니다.
- 초당 60 토큰 이상 → 즉각적. 읽는 것보다 빠릅니다. 실시간 자동 완성 및 빠른 반복에 이상적.
저사양 PC에서 피해야 할 것들
- 13B 이상 모델을 실행하지 마십시오 — RAM 한계를 초과합니다. Q4에서 13B 모델은 VRAM 8–10 GB가 필요하여 실용적인 저사양 PC 용량을 초과합니다. 적극적인 Q2 양자화로도 13B 모델은 5–6 GB가 필요하여 OS 및 GPU 스케줄링 오버헤드를 위한 공간이 부족합니다. 7B 이하로 유지하십시오.
- Q8 양자화를 피하십시오 — 최소한의 품질 향상에 비해 더 느립니다. Q8은 Q4보다 거의 2배의 VRAM을 사용하면서 (Mistral Small의 경우 8 GB vs 5.5 GB) 품질 향상은 약 2%에 불과합니다. 4 GB 시스템에서 Q8은 비실용적이며, 8 GB 시스템에서도 Q4가 최적입니다. Q4가 OOM을 일으킬 때만 Q3가 고려할 가치 있는 트레이드오프입니다.
- 실시간 자동 완성 성능을 기대하지 마십시오. CPU에서 초당 3 토큰으로 50 토큰을 생성하는 데 16초가 걸립니다. 대화형 자동 완성에는 초당 20 토큰 이상이 필요합니다. 저사양 CPU의 로컬 LLM은 배치 채팅, 초안 작성, 검토에는 적합하지만 실시간 자동 완성이나 타이핑 중 코드 생성에는 적합하지 않습니다.
- CPU 전용 추론을 프로덕션 챗봇에 사용하지 마십시오. 내부 도구, 프로토타입, 오프라인 배치 작업에는 허용 가능합니다. 클라우드 API (15–20 ms 지연)는 사용자 대면 서비스에서 저사양 CPU (300 ms 이상 지연)보다 우수합니다. 속도가 중요한 상황이 아닌 개인정보 보호가 중요하거나 오프라인 시나리오에서 로컬 추론을 사용하십시오.
일반적인 실수
- 실수: 더 빠른 속도를 위해 CPU에서 TinyLlama를 사용. 문제: TinyLlama는 CPU가 아닌 VRAM 4 GB용 — Phi-4-mini 3.8B는 CPU 전용 하드웨어에서 더 빠르고 훨씬 우수합니다. 해결책: CPU에서 Phi-4-mini 3.8B를 실행하고, VRAM 4 GB에는 TinyLlama Q5를 유지하십시오.
- 실수: CPU 가속 플래그를 활성화하지 않음. 문제: AVX/NEON을 놓치면 비용 없이 20% 속도 향상을 놓칩니다. 해결책: Ollama 실행 전에 `LLAMACPP_AVX512=1` 또는 `LLAMACPP_NEON=1`을 설정하십시오.
- 실수: 7B를 4GB에 넣기 위해 Q2로 양자화. 문제: Q2 양자화는 추론 중 KV 캐시 오버헤드로 인한 메모리 부족 충돌을 자주 일으킵니다. 해결책: 대신 Q4의 3B 모델을 사용하십시오.
- 실수: 최신 하드웨어가 항상 더 빠른 추론을 의미한다고 가정. 문제: 데스크톱 Ryzen은 데스크톱 소프트웨어에 메모리 최적화가 부족하기 때문에 모바일 ARM보다 토큰당 속도가 빠르지 않습니다. 해결책: 실제 하드웨어를 벤치마크하십시오.
- 실수: 모델에 잘못된 Ollama 슬러그 사용. 문제: `ollama run phi`는 Phi-4-mini가 아닌 Phi-2를 불러옵니다. 해결책: 최신 Phi 모델에는 `ollama run phi4-mini`를 사용하십시오. 정확한 모델 태그는 항상 ollama.com/library를 확인하십시오.
저사양 PC의 로컬 LLM: 지역별 상황
한국: 개인정보보호법(PIPA) 및 데이터 3법 개정에 따라, 로컬 하드웨어에서의 추론은 추론 데이터가 기기를 떠나지 않으므로 국외 이전 관련 요건을 단순화합니다. 금융, 의료 등 규제 산업에서 내부 문서 처리에 로컬 LLM을 사용하는 중소기업의 경우, 저사양 CPU에서도 실용적인 오프라인 대안이 됩니다.
EU / GDPR: 저사양 하드웨어에서 로컬로 실행: 추론 데이터가 기기를 떠나지 않습니다 — 많은 중소기업과 프리랜서에게 GDPR 제44조 이전 위험을 피하는 기술적으로 간단한 방법입니다. EU AI 법 (2025년 2월 발효)은 개인 사용 추론에 문서화 요구 사항을 부과하지 않습니다.
일본: METI AI 거버넌스 가이드라인은 데이터 최소화를 장려합니다. 저사양 하드웨어에서의 CPU 추론은 느리지만, 가장 엄격한 데이터 주권 요구 사항을 충족합니다 — API 호출 없음, 로깅 없음, 제3자 데이터 접근 없음. 일본어 작업을 위해 CPU에서 Qwen3을 실행하는 사용자의 경우, 비시간 중요 문서 요약에는 초당 1–3 토큰의 처리량으로 충분합니다.
저사양 PC에서 로컬 LLM 실행에 관한 자주 묻는 질문
로컬 LLM 실행을 위한 저사양 PC의 기준은 무엇입니까?
로컬 LLM을 위한 저사양 PC는 독립 GPU가 없는 CPU 전용 머신으로, 시스템 RAM이 4–16 GB인 경우입니다. 여기에는 Intel Iris 또는 AMD Radeon 내장 그래픽이 있는 대부분의 노트북, 독립 GPU가 없는 구형 데스크톱, Intel N100과 같은 미니 PC가 포함됩니다. 핵심 제약은 CPU 클럭 속도가 아니라 모델 가중치를 위한 시스템 RAM입니다.
GPU 없이 7B급 모델을 실행할 수 있습니까?
예 — Qwen3 8B (Q4_K_M)는 RAM 16 GB, CPU 전용에서 초당 8–15 토큰으로 동작합니다 (Ryzen 7 7700X에서 테스트). 더 작은 옵션보다 느리지만 품질은 눈에 띄게 좋습니다. RAM 8 GB인 경우 대신 Phi-4-mini (3.8B)를 사용하세요 — 8B 모델은 Q4_K_M에서 8 GB 시스템이 안정적으로 보장하지 못하는 여유 공간이 필요합니다.
CPU 추론을 챗봇에 사용할 수 있습니까?
적절한 모델 크기를 선택하면 대화형 용도로도 사용할 수 있습니다. Phi-4-mini (초당 15–25 토큰, RAM 8 GB)와 Qwen3 1.7B (초당 25–40 토큰, RAM 4 GB) 모두 실시간 채팅에 충분히 빠릅니다. CPU상의 7B급 모델(초당 8–15 토큰)은 실시간 대화보다는 초안 작성, 요약, 오프라인 검토 같은 배치 작업에 더 적합합니다.
CPU 전용 하드웨어에서는 Phi-4-mini와 Qwen3 1.7B 중 어느 것을 사용해야 합니까?
RAM 8 GB가 있다면 Phi-4-mini (3.8B)를 사용하세요 — 초당 15–25 토큰으로 코딩과 추론을 처리합니다. RAM 4 GB뿐이거나 가능한 가장 빠른 응답(초당 25–40 토큰)을 원한다면 Qwen3 1.7B를 사용하세요 — 단, 복잡한 작업에서는 품질이 다소 희생됩니다.
GPU가 있는지 어떻게 확인합니까?
독립 NVIDIA GPU의 경우 터미널에서 `nvidia-smi`를 실행하십시오. "command not found"가 반환되면 `lspci` (Linux) 또는 장치 관리자 (Windows)에서 Intel Iris Xe 또는 AMD Radeon iGPU를 확인하십시오 — CUDA를 지원하지 않아도 일부 레이어를 오프로드할 수 있습니다.
양자화는 추론 속도에 어떤 영향을 미칩니까?
양자화는 주로 계산이 아닌 메모리 대역폭 요구 사항을 줄입니다. Q2 (2비트)는 모델이 순전파당 더 적은 바이트를 로드하기 때문에 Q4 (4비트)보다 약 30% 빠릅니다. 하지만 Q2는 약 10% 품질 손실이 있습니다. 실용적 규칙: 이 가이드의 모든 티어에서 기본값은 Q4_K_M이며, RAM에 맞지 않을 때만 Q3로 낮추십시오.
Q2 미만의 양자화를 사용할 수 있습니까?
기술적으로 가능하지만 (Q1), 품질이 치명적으로 저하됩니다 — 정확도 손실이 최대 30%. 이 가이드의 RAM 4GB 티어를 포함해 어떠한 실용적인 사용 사례에도 권장하지 않습니다.
CPU + iGPU 하이브리드 추론이 지원됩니까?
예, 레이어 오프로딩을 통해 가능합니다. Intel Iris Xe iGPU가 있는 RAM 8GB 시스템에서 Qwen3 4B는 부분 오프로드로 초당 12–20 토큰에 도달하며 CPU 전용보다 빠릅니다. `OLLAMA_NUM_GPU=1`을 설정하면 Ollama가 맞는 레이어를 자동으로 오프로드합니다.
저사양 PC를 위한 가장 빠른 로컬 LLM은 무엇입니까?
Qwen3 1.7B (Q4_K_M)가 이 가이드에서 가장 빠른 모델입니다 — 최신 i5/Ryzen 5, RAM 4 GB, GPU 없이 초당 25–40 토큰. 비슷한 속도에서 더 나은 품질을 원한다면 Phi-4-mini (3.8B)가 RAM 8 GB에서 초당 15–25 토큰으로 동작하며 코딩과 추론을 훨씬 잘 처리합니다.
RAM 4 GB에서 로컬 LLM을 실행할 수 있습니까?
예 — Qwen3 1.7B (Q4_K_M)가 RAM 4 GB, CPU 전용에 권장되는 모델이며, 최신 i5/Ryzen 5에서 초당 25–40 토큰에 도달합니다. 이 가이드에서 가장 빠른 모델이며 OS를 위한 여유 공간을 남기고 맞습니다.
속도를 위해 GPU가 필요합니까?
아니요 — 이 가이드의 모든 모델은 CPU 전용으로 실행됩니다. Intel Iris iGPU는 눈에 띄는 속도 향상을 제공하지만 (Qwen3 4B: 부분 오프로드로 초당 12–20 토큰 vs. CPU 전용) 선택 사항입니다. 중고 RTX 4060 8GB 같은 독립 GPU는 어떤 CPU 구성보다 5–10배 빠르지만, 이는 필수가 아닌 별도의 업그레이드 경로입니다.
출처
- Phi-4 Mini 모델 카드 — Microsoft Research. MMLU 68%, HumanEval 70%. 2025년 출시.
- Gemma 3 모델 카드 — Google DeepMind. 128K 컨텍스트 창의 Gemma 3 2B. 2025년 출시.
- Llama 4 Scout 8B — Meta. 1,000만 컨텍스트 창, 2026년 3월 출시.
- TinyLlama 1.1B 저장소 — Stability AI. 2024년 훈련 완료. 모델 안정적, 더 이상 업데이트 없음. VRAM 4 GB 티어에 여전히 권장.
- llama.cpp CPU 최적화 가이드 — AVX-512, NEON 및 스레드 구성을 포함한 CPU 가속 플래그.
