TL;DR
- 16GB: 7B 모델만 가능(부족)
- 36GB: 13B 여유롭게, 34B Q4 빠듯함
- 64GB: 34B Q5 여유롭게
- 128GB: 70B Q5 여유롭게
- 구매 후 업그레이드 불가 — 구매 시 최대 메모리 선택
Key Takeaways
- 통합 메모리 = CPU와 GPU 공유 — 전체 용량을 LLM 모델에 사용 가능합니다.
- RTX 4070은 12GB VRAM + 32GB RAM(분리). Mac은 통합 = 전체 사용 가능.
- 64GB Mac에서 macOS 오버헤드(4–8GB) 제외 시 LLM에 약 56–60GB 사용 가능합니다.
- 스왑 존재: 모델이 여유 메모리를 초과하면 macOS가 SSD를 사용합니다. 작동하지만 5–10배 느립니다.
- 양자화에 따른 모델 크기(GB) 차이: Llama 3.3 8B는 FP16 16GB, Q4 5GB, Q8 8.5GB입니다.
- 원칙: 최대 메모리를 구매하십시오 — 구매 후 업그레이드 불가. 판매 시 메모리 비용은 5–10%이지만, 나중에 Mac 전체 교체는 100% 비용이 발생합니다.
Apple Silicon 로컬 LLM: 16 GB는 7B만 가능(빠듯), 36 GB는 13B 쾌적, 64 GB는 70B Q3(빠듯) 또는 34B Q5(쾌적), 128 GB는 70B Q5 쾌적 — 메모리는 구매 후 업그레이드 불가, 처음부터 최대 용량으로 구매할 것.
Mac의 통합 메모리는 CPU, GPU, AI 엔진 간에 공유됩니다. 경험 법칙: 7B 모델 Q4는 약 5 GB; 14B는 약 9 GB; 70B Q4는 약 42 GB 필요. OS용으로 8 GB 추가. 모델이 맞지 않으면 디스크로 스왑 — 100배 느려집니다.
LLM을 위한 통합 메모리 작동 방식
통합 메모리는 CPU와 GPU 간에 공유되며 전체 용량을 모델에 사용할 수 있습니다. 별도의 GPU(RTX 4070은 12GB VRAM + 32GB RAM 분리)와 달리, Apple Silicon은 하나의 풀을 공유합니다. 64GB Mac = 모델에 64GB 사용 가능. macOS와 앱이 4–8GB를 사용하므로 LLM에 56–60GB가 남습니다.
통합 메모리는 VRAM과 같은가요?
네 — Apple Silicon에서 통합 메모리는 실질적으로 GPU의 VRAM입니다. 개별 GPU처럼 고정되고 분리된 VRAM 풀은 존재하지 않습니다. M 시리즈 칩의 CPU, GPU, Neural Engine은 동일한 물리 메모리를 읽고 쓰기 때문에, 통합 메모리 풀의 일부가 아니라 거의 전체가 LLM 실행 시 GPU에서 사용 가능합니다.
- 개별 GPU(RTX 4070): PC에 64GB의 별도 시스템 RAM이 있어도 12GB VRAM이 모델 가중치의 고정 상한선입니다.
- Apple Silicon: GPU는 macOS 오버헤드(4–8GB)를 제외한 전체 통합 메모리 풀에 접근할 수 있습니다 — 64GB Mac은 고정된 12–24GB VRAM 조각이 아니라 GPU에 약 56–60GB를 제공합니다.
- 이것이 64GB Mac은 34B 모델을 여유롭게 실행할 수 있지만 12GB GPU를 탑재한 64GB PC는 그럴 수 없는 이유입니다 — PC의 GPU 접근 가능 메모리는 전체 RAM이 아니라 VRAM에 의해 제한됩니다.
- "공유 메모리"와 "통합 메모리"는 동일한 아키텍처를 설명합니다: 수동 VRAM 할당 단계 없이 CPU와 GPU 모두 주소를 지정할 수 있는 하나의 풀입니다.
마스터 표: 메모리 티어 vs 모델 크기
| 모델 | 파라미터 | Q3_K | Q4_K_M | Q5_K_M | Q8 | FP16 |
|---|---|---|---|---|---|---|
| Phi-4 | 3.8B | 2.1 GB | 2.5 GB | 2.9 GB | 4.0 GB | 7.6 GB |
| Mistral Small | 7B | 3.8 GB | 4.5 GB | 5.2 GB | 7.5 GB | 14 GB |
| Llama 3.3 8B | 8B | 4.2 GB | 5.0 GB | 5.8 GB | 8.5 GB | 16 GB |
| Llama 3.3 13B | 13B | 7.0 GB | 8.5 GB | 9.8 GB | 14 GB | 26 GB |
| Qwen3 34B | 34B | 17 GB | 20 GB | 24 GB | 36 GB | 68 GB |
| Llama 3.3 70B | 70B | 36 GB | 42 GB | 49 GB | 74 GB | 140 GB |
| Llama 3.3 405B | 405B | 200+ GB | 240 GB | 280 GB | 410 GB | 810 GB |
Mac에서 적합 여부 계산 시 macOS 오버헤드 4-8 GB를 추가하십시오.
적합/부적합 매트릭스
| 모델 + 양자화 | 16GB | 36GB | 64GB | 128GB |
|---|---|---|---|---|
| Phi-4 Q4 (2.5 GB) | ✓ 충분 | ✓ 충분 | ✓ 충분 | ✓ 충분 |
| Llama 3.3 8B Q4 (5 GB) | ⚠️ 빠듯 | ✓ 여유 | ✓ 충분 | ✓ 충분 |
| Llama 3.3 8B Q8 (8.5 GB) | ✗ 불가 | ✓ 여유 | ✓ 충분 | ✓ 충분 |
| Llama 3.3 13B Q4 (8.5 GB) | ✗ 불가 | ✓ 여유 | ✓ 충분 | ✓ 충분 |
| Qwen3 34B Q4 (20 GB) | ✗ 불가 | ⚠️ 빠듯 | ✓ 여유 | ✓ 충분 |
| Qwen3 34B Q5 (24 GB) | ✗ 불가 | ✗ 불가 | ✓ 여유 | ✓ 충분 |
| Llama 3.3 70B Q3 (36 GB) | ✗ 불가 | ✗ 불가 | ⚠️ 빠듯 | ✓ 여유 |
| Llama 3.3 70B Q4 (42 GB) | ✗ 불가 | ✗ 불가 | ⚠️ 매우 빠듯 | ✓ 여유 |
| Llama 3.3 70B Q5 (49 GB) | ✗ 불가 | ✗ 불가 | ✗ 불가 | ✓ 여유 |
| Llama 3.3 70B Q8 (74 GB) | ✗ 불가 | ✗ 불가 | ✗ 불가 | ✓ 가능 |
✓ 충분 = 여유 4+ GB | ✓ 여유 = 여유 2-4 GB | ⚠️ 빠듯 = 여유 2 GB 미만 | ✗ 불가 = 스왑 사용 또는 충돌

각 메모리 티어에서 실행 가능한 모델(실용적)
- 116 GB (M5 base, MacBook Air)
Why it matters: Llama 3.3 8B Q4 가능(5GB 모델 + 8GB OS = 13GB) ✓ 하지만 빠듯함. Llama 8B Q8은 스왑 없이 불가. Whisper small은 함께 실행 가능. - 236 GB (M5 Pro base)
Why it matters: Llama 3.3 8B Q8 여유롭게 가능. Llama 13B Q4 가능. Qwen3 34B Q4 겨우 가능(20GB + 8GB OS = 28GB). 멀티 모델: Whisper + LLaVA + TTS 동시 실행 가능 ✓ - 364 GB (M5 Pro max)
Why it matters: Qwen3 34B Q5 여유롭게 가능(24GB). Llama 70B Q3 겨우 가능. 멀티 모델 스택을 위한 충분한 여유 공간. - 4128 GB (M5 Max)
Why it matters: 128GB에 가장 적합한 모델: Llama 3.3 70B Q5(49GB) — 여유롭게 실행 가능한 가장 큰 주류 모델. 70B Q8도 가능(74GB)하며 손실이 거의 없는 품질. 멀티모달: Whisper + 90B 비전 모델 + 8B LLM 동시 실행 가능 ✓
멀티 모델 스택 메모리 요구 사항
| 스택 사용 사례 | 필요 메모리 |
|---|---|
| LLM만 (Llama 8B Q4) | 5 GB + OS = 13 GB |
| LLM + STT (Llama 8B + Whisper large-v3) | 8 GB + OS = 16 GB |
| LLM + STT + TTS (음성 어시스턴트) | 9 GB + OS = 17 GB |
| LLM + 비전 (Llama 8B + LLaVA 7B) | 11 GB + OS = 19 GB |
| 전체 멀티모달 (LLM + 비전 + STT + TTS) | 14 GB + OS = 22 GB |
| LLM + RAG (Llama 8B + 임베딩 + ChromaDB) | 8 GB + OS = 16 GB |
| 헤비 멀티모달 (Llama 70B Q4 + Vision 90B) | 100+ GB |
22 GB 이상의 스택은 최소 36GB Mac이 필요합니다. 50 GB 이상의 스택은 최소 64GB Mac이 필요합니다. 헤비 멀티모달 스택은 128GB M5 Max에서만 작동합니다.
컨텍스트 윈도우가 메모리 오버헤드를 추가합니다
KV 캐시는 컨텍스트 길이에 따라 확장됩니다 — 컨텍스트 윈도우가 길수록 런타임에 모델이 더 많은 메모리를 사용합니다. 이는 빠듯한 설정을 스왑으로 밀어넣을 수 있는 흔한 함정입니다.
- Llama 3.3 8B, 8K 컨텍스트: +0.5 GB
- Llama 3.3 8B, 32K 컨텍스트: +2 GB
- Llama 3.3 8B, 128K 컨텍스트: +8 GB
- Llama 3.3 70B, 32K 컨텍스트: +6 GB
- Llama 3.3 70B, 128K 컨텍스트: +24 GB
최대 메모리를 구매해야 하는 이유
- 구매 후 Apple Silicon 메모리 업그레이드 불가합니다.
- 모델 크기가 성장 중: 현재 8B → 2027년 13–34B가 스위트 스팟.
- 16GB는 LLM에 이미 부족합니다 — 최소 36GB 권장.
- 가격 차이: 구매 시 36GB→64GB는 약 $200 추가이며, 2년 후 36GB 용량을 초과하는 모델 때문에 새 Mac 구매를 막을 수 있습니다.
- 예시: M5 Pro 36GB는 현재 $999; 64GB는 $1,199. 2년 후 새 Mac 구매: 동일한 M5 Pro 64GB 구성에 $1,500+(이용 가능한 경우).
- 36GB 이상 통합 메모리를 가장 저렴하게 얻는 방법: 기본 M5 Pro Mac mini($999, 36GB)는 13B 모델을 여유롭게 실행할 수 있는 가장 저렴한 Mac입니다 — 동급 메모리의 Mac Studio나 MacBook Pro보다 저렴합니다.

양자화가 품질에 미치는 영향
Q4_K_M (4비트): FP16 대비 품질 손실 약 1–2%. 대부분의 용도에서 차이를 느낄 수 없습니다. 가장 좋은 기본값.
Q5_K_M (5비트): 품질 손실 약 0.5–1%. 무시할 수준. 여유 메모리가 있다면 권장.
Q8 (8비트): 품질 손실 약 0.1%. 사실상 무손실.
Q3_K (3비트): 품질 손실 3–5%. 복잡한 추론에서 눈에 띕니다. 공간이 제한된 경우에만 허용.
36GB와 64GB 중 어느 것을 선택해야 합니까?
예산이 허락한다면 64GB를 구매하십시오($200 추가). 36GB는 현재 작동하지만 모델이 성장함에 따라 12개월 후에는 부족하게 느껴질 것입니다. 64GB는 2027–2028년까지 미래 대비가 됩니다.
나중에 메모리를 업그레이드할 수 있습니까?
아니요. Apple Silicon 메모리는 솔더링되어 있어 업그레이드가 불가능합니다. 구매 시 최대 용량을 선택하십시오.
16GB가 충분하지 않은 이유는 무엇입니까?
LLM에 16GB + macOS에 4–8GB = 사용 가능한 용량 8–12GB. Llama 8B Q4는 5GB가 필요하므로 Whisper나 다른 작업을 위한 공간이 없습니다. 너무 빠듯합니다.
128GB가 정말 필요합니까?
70B 모델을 정기적으로 실행하거나 비전 + LLM + STT를 동시에 사용해야 하는 경우에만 필요합니다. 그렇지 않다면 64GB로 충분합니다.
48GB가 로컬 LLM에 충분합니까?
네 — 48GB(M4 Pro 및 일부 M5 Pro 구성에서 사용 가능)는 편안한 중간 지점입니다. 모든 34B 모델, 70B Q3(한계에서), 전체 멀티모달 스택을 실행합니다. 36GB보다 낫지만, 64GB를 구매할 수 있다면 미래 대비 가치가 있습니다.
Llama 3.3 70B를 로컬에서 실행하려면 메모리가 얼마나 필요합니까?
최소 48GB(Q3 양자화, 눈에 띄는 품질 저하). 권장 64GB(Q4 양자화, 빠듯한 적합). 여유로운 128GB(Q5/Q8 양자화, 높은 품질). 64GB 티어는 신중한 메모리 관리가 필요하며; 128GB만이 70B를 위한 유일한 걱정 없는 옵션입니다.
2026년 로컬 AI를 위해 128GB가 필요합니까?
70B 모델을 정기적으로 실행하거나 비전 + LLM + STT 스택을 동시에 사용해야 하는 경우에만 필요합니다. 일상적인 LLM 사용(8B-34B 모델, RAG, 코딩 지원)에는 64GB M5 Pro가 최적입니다. 128GB는 70B가 특별히 필요한 경우가 아니라면 한계 이득을 위한 2-3배 가격 인상입니다.
Apple Silicon의 통합 메모리는 VRAM과 같은가요?
네. 고정되고 분리된 VRAM을 가진 개별 GPU(예: RTX 4070의 12GB)와 달리, Apple Silicon의 GPU는 CPU와 동일한 물리 메모리를 읽고 씁니다. GPU는 Mac 통합 메모리의 거의 전체에 접근할 수 있습니다 — 64GB Mac은 macOS 오버헤드 이후 GPU에 약 56-60GB를 제공하며, 고정된 VRAM 조각이 아닙니다.
128GB 통합 메모리에 들어가는 가장 큰 LLM은 무엇인가요?
Q5_K_M 양자화의 Llama 3.3 70B(49GB)가 여유롭게 들어가는 가장 큰 주류 모델로, 컨텍스트와 오버헤드를 위해 약 70GB가 남습니다. Q8(74GB)도 macOS를 위한 여유를 남기고 들어갑니다. 405B 모델은 Q4에서도 240GB 이상이 필요합니다 — 단일 Mac의 통합 메모리를 초과하므로, 70B가 한 기기에서 실용적인 한계입니다.
메모리와 별개로 로컬 LLM에는 얼마나 많은 저장 공간이 필요한가요?
메모리(RAM)와 디스크 저장 공간은 다릅니다: 메모리는 실행 중인 모델을 보관하고, 저장 공간은 다운로드한 모델 파일을 영구적으로 보관합니다. Q4 8B 모델은 메모리와 디스크 모두 약 5GB가 필요합니다. 70B Q5 모델은 약 49GB의 메모리와 약 49GB의 디스크(동일한 파일)가 필요합니다. 여러 모델(예: 8B, 34B, 70B에 비전 모델 추가)을 로컬에서 실행하려면 Mac의 메모리 티어와 무관하게 100-150GB의 여유 디스크 공간이 필요합니다.
