Key Takeaways
- GPU (NVIDIA RTX 5090): 8B 모델에서 초당 200토큰. 최고 성능, $2,000.
- GPU (NVIDIA RTX 4090): 8B 모델에서 초당 150토큰. 최고 가성비: RTX 4070 Ti, $600에 초당 80토큰.
- Apple Silicon M2 Ultra: 8B에서 초당 60토큰, 70B를 *네이티브*로 초당 35토큰(오프로딩 없음). 고유한 장점: Mac Studio는 품질 손실 없이 70B 모델을 실행하는 유일한 소비자용 하드웨어입니다.
- CPU (Intel i9): 초당 5~6토큰. 실시간 채팅에는 비실용적(5~10초 지연).
- 본격적인 작업의 경우: GPU가 속도에서 승리합니다(메모리 대역폭으로 인해 30~40배 빠름). Apple M2 Ultra는 대형 모델에서 승리합니다(네이티브 70B 실행).
로컬 LLM: Apple M5 Pro 64GB(~$2,399)가 30B 모델에서 40–60 tok/s로 종합 최고; RTX 5090 32GB(~$2,000)는 7B–14B 최속(150–200 tok/s)이지만 30B 이상 불가; RTX 5070 12GB(~$600)가 GPU 최고 가성비; CPU 단독: 7B에서 10–20 tok/s.
GPU는 높은 컴퓨팅 대역폭으로 소형 모델(14B 미만)에서 가장 빠릅니다. Apple Silicon은 메모리와 컴퓨팅을 통합해 낮은 전력으로 대형 모델(30B+)에 최적입니다. CPU 단독은 가장 느리지만 어떤 노트북에서도 동작합니다.
성능 비교: 속도 및 처리량
*RAM으로 오프로딩 포함 — 상당한 품질 저하 발생
| Hardware | Llama 3.2 8B | Llama 3.3 70B | Qwen3 32B | Cost |
|---|---|---|---|---|
| RTX 5090 (GPU, 32 GB) | 200 tok/sec | 50 tok/sec | 70 tok/sec | $2,000 |
| RTX 4090 (GPU, 24 GB) | 150 tok/sec | 10 tok/sec* | 50 tok/sec | $1,800 |
| RTX 4070 Ti (GPU, 12 GB) | 80 tok/sec | 불가능 | 25 tok/sec | $600 |
| Mac Studio M2 Ultra (192 GB) | 60 tok/sec | 35 tok/sec | 45 tok/sec | $4,000 |
| MacBook Pro M4 Max (128 GB) | 35 tok/sec | 8 tok/sec* | 22 tok/sec | $4,000 |
| MacBook Pro M5 Max (96 GB) | 25 tok/sec | 5 tok/sec* | 15 tok/sec | $3,500 |
| Intel i9 14900K (CPU 전용) | 5 tok/sec | 1 tok/sec | 2 tok/sec | $600 |
| AMD Ryzen 9 7950X (CPU 전용) | 6 tok/sec | 1 tok/sec | 2 tok/sec | $650 |
NVIDIA GPU: 성능의 왕
NVIDIA GPU(RTX 40/50 시리즈)는 2026년 4월 기준 로컬 LLM에 최적인 하드웨어입니다. 우위의 이유:
- CUDA 생태계: AI 특화 최적화 20년 이상. 대부분의 모델이 CUDA를 우선으로 최적화되어 있습니다.
- 텐서 코어: 행렬 연산 전용 하드웨어(LLM 추론의 핵심).
- 메모리 대역폭: RTX 5090은 1,792 GB/sec(GDDR7), RTX 4090은 1,008 GB/sec로 통합 메모리 시스템을 훨씬 초과합니다.
- 성숙한 소프트웨어: vLLM, llama.cpp, LM Studio 모두 NVIDIA에 최적화되어 있습니다. 네이티브 정밀도에서 최고의 추론 성능.
- RTX 5090(2025 플래그십): Llama 3.2 8B에서 초당 200토큰, 70B를 초당 50토큰에 처리 가능.
단점: 높은 초기 비용($600~$2,000), 전력 소비(350~575W), 우수한 냉각 및 1200W PSU 필요.
CPU 전용: 피해야 할 경우와 이유
CPU로 LLM을 실행할 수 있지만 실시간 추론에는 비실용적입니다:
- 지연 시간: 7B 모델 응답당 5~10초. 채팅에 사용 불가.
- 전력: 최대 부하 시 CPU는 200W 이상 소비(추론에 비효율적).
- 컨텍스트: CPU는 긴 컨텍스트(키-값 캐시)에서 성능이 크게 저하됩니다.
CPU는 실시간 응답이 필요 없는 오프라인 배치 처리(예: 밤새 문서 처리)에만 적합합니다.
Apple Silicon: 대형 모델에서의 고유한 강점
Apple M 시리즈(M2 Ultra, M3/M4 Max)는 대형 모델을 네이티브로 실행하는 데 탁월합니다 — 고유한 장점:
- 통합 메모리: CPU와 GPU가 메모리 풀을 공유하여 전송 오버헤드를 제거합니다.
- 대형 모델 지원: Mac Studio M2 Ultra(192GB)는 Llama 3.3 70B를 네이티브로 초당 35토큰에 실행합니다. 오프로딩 없음. Apple Silicon만의 고유한 특성.
- 와트당 효율: M5 Max는 7B를 25W에서 초당 25토큰으로 처리합니다. M4 Max는 더 빠릅니다(약 35토큰/초).
- 통합성: macOS 네이티브, 드라이버 문제 없음, 즉시 사용 가능.
- GPU 한계: 공유 메모리는 별도 VRAM 업그레이드가 불가능함을 의미합니다. 모델 크기 ≤ 시스템 RAM.
Mac Studio M2 Ultra(192GB): 8B에서 초당 60토큰, 70B에서 초당 35토큰 — 이 기능을 갖춘 유일한 소비자용 하드웨어. 70B+ 모델을 연구하는 팀은 Mac Studio를 고려해야 합니다.
MacBook Pro: M4 Max(128GB), 8B에서 초당 35토큰은 모바일 환경에 적합합니다. M5 Max(96GB), 초당 25토큰은 가벼운 요구 사항에 적합합니다.
**M5 Pro 및 M5 Max의 로컬 LLM 전용 벤치마크는 Apple Silicon M5 전용 비교 →를 참조하십시오.**
메모리 대역폭: 실제 속도 병목 현상
LLM 추론은 연산 제한이 아닌 메모리 제한입니다. 토큰 생성 속도는 메모리에서 모델 가중치를 얼마나 빠르게 로드할 수 있는지에 의해 제한됩니다. 메모리 대역폭이 높을수록 = 토큰 생성이 빠릅니다.
공식: 추론 속도 ≈ 메모리 대역폭 ÷ 메모리 내 모델 가중치
- 이 대역폭 차이가 GPU가 추론에서 CPU보다 30~40배 빠른 이유를 설명합니다.
- Apple Silicon 통합 메모리는 NVIDIA GDDR7/GDDR6X보다 바이트당 대역폭이 낮지만, DDR5 RAM보다는 9배 빠릅니다.
- 통합 메모리 장점: CPU↔GPU 전송 오버헤드가 없습니다. 모델이 하나의 메모리 풀에 유지됩니다.
- GPU의 대형 모델 단점: VRAM 용량이 제한적입니다(RTX 4090 최대 24GB). 시스템 RAM(89GB/s)으로 오프로딩 시 10배 속도 패널티가 발생합니다.
- Mac Studio M2 Ultra(192GB 통합)가 고유한 이유: 800GB/s 대역폭으로 70B 모델을 네이티브로 수용 가능 — 오프로딩 패널티 없음, 속도 급감 없음.
| Platform | Memory Bandwidth | Effective Speed (8B) |
|---|---|---|
| RTX 5090 (GDDR7) | 1,792 GB/s | 200 tok/sec |
| RTX 4090 (GDDR6X) | 1,008 GB/s | 150 tok/sec |
| RTX 4070 Ti (GDDR6X) | 504 GB/s | 80 tok/sec |
| Mac Studio M2 Ultra (통합) | 800 GB/s | 60 tok/sec |
| MacBook Pro M4 Max (통합) | 546 GB/s | 35 tok/sec |
| MacBook Pro M5 Max (통합) | 400 GB/s | 25 tok/sec |
| DDR5-5600 RAM (CPU 전용) | 89 GB/s | 5 tok/sec |
| DDR4-3200 RAM (CPU 전용) | 51 GB/s | 3 tok/sec |
토큰당 비용: 실제 비용 분석
추론의 총 비용을 고려하십시오(시간에 따른 하드웨어 상각):
| Hardware | Initial Cost | Tokens/Sec | Tokens/Year (24/7) | Long-term Cost |
|---|---|---|---|---|
| RTX 4090 (3년 수명) | $1,800 | 150 | 47억 | 1M 토큰당 $0.0004 |
| RTX 4070 Ti (3년) | $600 | 80 | 25억 | 1M 토큰당 $0.0002 |
| M5 Max Mac (이미 보유) | $0 | 25 | 7.9억 | 1M 토큰당 $0 |
| OpenAI API ($0.01 per 1K tokens) | 사용량 기반 | 무제한 | 무제한 | 1M 토큰당 $10 |
각 플랫폼을 선택해야 할 경우
의사결정 프레임워크:
- GPU 선택: 실시간 채팅(<1초 지연)이 필요하거나, 24/7 모델을 실행하거나, 대용량 데이터셋을 배치 처리하는 경우.
- CPU 전용 선택: 오프라인 환경이거나, 밤새 문서를 배치 처리해야 하거나, 하드웨어 투자가 전혀 없는 경우.
- Apple Silicon 선택: Mac을 보유하고 있으며, 7B 모델만 실행하고, 낮은 전력 소비를 중시하는 경우.
하드웨어 선택 시 흔한 실수
- CPU가 채팅에 실용적이라고 생각하는 것. 응답당 5초 지연은 실용적이지 않습니다. 사용자 경험이 불가능합니다.
- 구형 GPU가 비슷한 성능을 낼 것이라 예상하며 구매하는 것. RTX 2080은 아키텍처 개선으로 인해 RTX 4070 Ti보다 10배 느립니다.
- M5 Max가 70B 모델을 처리할 수 있다고 가정하는 것. 극단적인 양자화에서도 불가능합니다. 통합 메모리 아키텍처에 의해 제한됩니다.
- 전력 및 냉각 요구 사항을 무시하는 것. RTX 4090은 1200W PSU와 우수한 케이스 환기가 필요하며, 단순히 "GPU 슬롯"만 필요한 것이 아닙니다.
자주 묻는 질문
로컬 LLM 실행에 GPU와 CPU 중 어느 것이 더 낫습니까?
GPU가 실시간 추론에 훨씬 더 우수합니다. NVIDIA RTX 4090은 7B 모델을 초당 150토큰으로 실행합니다. Intel i9 같은 고성능 CPU는 같은 모델을 초당 3~5토큰으로 실행합니다. CPU 추론은 5~10초의 응답 지연을 발생시켜 대화형 채팅에 비실용적입니다.
Apple Silicon으로 로컬 LLM을 실행할 수 있습니까?
예. Apple M 시리즈(M3, M4)는 통합 메모리를 사용하여 7B 모델을 초당 25~30토큰으로 실행합니다 — CPU 전용 x86 시스템보다 훨씬 우수하지만 독립적인 NVIDIA GPU보다는 느립니다. Apple Silicon은 통합 메모리 한계로 인해 70B 모델을 실행할 수 없습니다(최대 시스템 RAM이 모델 메모리 한계와 같음).
로컬 LLM에 필요한 최소 GPU VRAM은 얼마입니까?
6GB VRAM은 Q4 양자화(4.1GB 사용)로 7B 모델을 실행합니다. 8GB는 Q5에서 7B 모델을 원활하게 실행하기 위한 실질적인 최소값입니다. 13B 모델을 최고 품질로 실행하려면 16GB 이상의 VRAM이 필요합니다. 24GB는 30B 모델을 처리합니다.
LLM 추론에서 GPU는 CPU보다 얼마나 빠릅니까?
NVIDIA GPU는 LLM 추론에서 CPU보다 30~100배 빠릅니다. RTX 4090은 7B 모델에서 초당 150토큰을 생성합니다. Intel i9는 초당 3~5토큰을 생성합니다. 속도 차이는 단순한 클럭 속도가 아니라 CUDA 병렬 처리와 전용 텐서 코어에서 비롯됩니다.
로컬 LLM만을 위해 GPU를 구매할 가치가 있습니까?
RTX 4070 Ti(12GB VRAM, 약 $600)를 3년에 걸쳐 상각하면 하루 2시간 이상 사용하는 헤비 유저의 OpenAI API 비용보다 저렴합니다. 초당 80토큰으로 실시간 채팅, 코딩 지원, 문서 요약을 처리합니다. 하루 30분 미만의 라이트 유저는 API를 이용하는 것이 더 낫습니다.
여러 CPU 코어를 사용하면 LLM 추론 속도를 높일 수 있습니까?
CPU 코어가 많을수록 약간 도움이 됩니다. llama.cpp는 사용 가능한 모든 스레드를 사용하지만, 병목은 메모리 대역폭(시스템 RAM 50~100GB/sec 대 GPU VRAM 2000+ GB/sec)입니다. 코어가 더 많다고 대역폭 문제가 해결되지 않습니다 — GPU 또는 Apple M 시리즈 통합 메모리 아키텍처만이 이를 해결합니다.
메모리 대역폭이란 무엇이며 LLM에서 왜 중요합니까?
LLM 추론은 연산 제한이 아닌 메모리 제한입니다. 토큰 생성 속도는 메모리에서 모델 가중치를 얼마나 빠르게 로드할 수 있는지에 의해 달라집니다. RTX 5090은 1,792 GB/s(GDDR7)이고, DDR5 RAM은 89 GB/s입니다. 이 대역폭 차이가 GPU가 추론에서 CPU보다 30~40배 빠른 이유를 설명합니다.
로컬 LLM에 가장 적합한 Apple Silicon 칩은 무엇입니까?
70B 모델을 네이티브로 초당 35토큰에 실행하려면 Mac Studio M2 Ultra(192GB) — 어떤 소비자용 GPU도 따라올 수 없는 고유한 장점입니다. 8B 모델에서 초당 35토큰의 휴대용 사용에는 MacBook Pro M4 Max(128GB). M5 Max(96GB)는 7~13B 모델에 적합합니다. 본격적인 LLM 작업에는 기본 M4/M3(8GB RAM)를 피하십시오.
Apple Silicon이 70B 모델을 실행할 수 있습니까?
Mac Studio M2 Ultra(192GB 통합 메모리)는 Llama 3.3 70B를 오프로딩 없이 네이티브로 초당 35토큰에 실행합니다. 이것은 고유합니다 — 어떤 소비자용 GPU도 이를 할 수 없습니다. 더 작은 Mac 모델(M5 Max, M4 Max)은 RAM으로 부분 오프로딩을 수행하여 5~10배의 속도 패널티가 발생합니다. 완전한 70B 품질은 Mac Studio M2 Ultra에서만 가능합니다.
RTX 5090은 로컬 LLM에 $2,000의 가치가 있습니까?
70B 모델을 정기적으로 실행하거나 프로덕션 워크로드가 있는 경우에만 가치 있습니다. RTX 5090(8B에서 초당 200토큰)은 RTX 4090($1,800)보다 2.5배 빠릅니다. 더 나은 가성비: 8B~32B 모델에는 RTX 4070 Ti($600, 초당 80토큰), 네이티브 70B 지원이 필요하다면 Mac Studio M2 Ultra($4,000).
출처
- NVIDIA GPU 사양 — RTX 40/50 시리즈 GPU 사양, VRAM, 메모리 대역폭.
- Apple M3 성능 — M5 Max 통합 메모리 아키텍처 및 추론 성능.
- vLLM 벤치마크 — 프로덕션 LLM 추론 처리량 벤치마크.
- 하드웨어마다 다른 토큰 속도를 생성하지만, 모든 추론은 구조화된 프롬프트의 혜택을 받습니다. 긴 컨텍스트 요청은 짧은 요청과 다른 기술이 필요합니다: 컨텍스트 윈도우 설명은 어떤 하드웨어에서든 적용할 수 있는 전략을 다룹니다.
