핵심 요점
- RTX 4090은 2026년 로컬 AI용 최고의 단일 소비자 GPU입니다: 24 GB VRAM, ~1 TB/s 메모리 대역폭
- 70B Q4 모델은 40 GB VRAM 이상이 필요합니다 — 듀얼 RTX 3090 또는 CPU 오프로딩 필요
- Ryzen 9 9950X(Zen 5, 16코어)는 대형 레이어의 빠른 CPU 오프로딩에 최적인 CPU입니다
- DDR5-6000 최소 64 GB; 128 GB는 70B 모델의 CPU 오프로딩을 유용한 속도로 가능하게 합니다
- NVMe PCIe Gen 4/5는 7B 모델을 SATA의 10초 이상에 비해 2초 미만에 로드합니다
- 세 빌드 모두 AM5 소켓을 사용합니다 — 마더보드 교체 없이 GPU/RAM 업그레이드 가능
1단계: $1,200 경제형 AI 워크스테이션
$1,200 경제형 빌드는 중고 RTX 3090(24 GB VRAM)을 핵심으로 사용합니다. Llama 3.3 8B Q8을 45–60 tok/s, Qwen3 14B Q8을 20–28 tok/s, Qwen3 32B Q4를 12–18 tok/s로 완전히 GPU에서 실행합니다. RTX 3090은 350 W를 소비합니다 — 고품질 850 W 파워 서플라이와 함께 사용하십시오.
- 전체 GPU 속도로 지원되는 모델: 7B (모든 양자화), 13B (Q4/Q8), 14B (Q4/Q8), 30B (Q4)
- 70B 지원: CPU 오프로딩 필요 — ~5–8 tok/s, 기능적이지만 이상적이지 않음
- 전력 소비: ~450 W 최대 (GPU 350 W + CPU 65 W + 나머지)
- 권장 파워 서플라이: Corsair RM850x 또는 동급 80+ Gold
| 부품 | 모델 | 가격 (2026년 5월) |
|---|---|---|
| GPU | NVIDIA RTX 3090 (중고, 24 GB) | ~$440 |
| CPU | AMD Ryzen 7 7700X | ~$180 |
| 마더보드 | MSI MAG X670E Tomahawk WiFi | ~$170 |
| RAM | 64 GB DDR5-5600 (2×32 GB) | ~$110 |
| 저장장치 | 2 TB PCIe Gen 4 NVMe | ~$90 |
| 파워 서플라이 | 850 W 80+ Gold 인증 | ~$90 |
| 케이스 | 미드타워 ATX, 팬 슬롯 3+ 개 | ~$70 |
| CPU 쿨러 | 240mm AIO 또는 타워형 | ~$60 |
| 합계 | ~$1,210 |
2단계: $2,500 추천형 AI 워크스테이션
$2,500 추천 빌드는 RTX 4090(24 GB, ~1 TB/s 메모리 대역폭)과 AMD Ryzen 9 9950X(Zen 5, 16코어)를 중심으로 합니다. 4090은 VRAM GB당 3090보다 30–40% 빠르며 토큰당 전력 소비가 적습니다. 이 빌드는 30B Q4 모델을 완전히 GPU에서 처리하고, 64 GB RAM으로 CPU 오프로딩을 통해 70B 모델을 10–15 tok/s로 실행합니다.
- 전체 GPU 속도로 지원되는 모델: 7B–30B (모든 양자화), 32B (Q4는 24 GB에 들어맞음)
- 70B 지원: 64 GB RAM으로 CPU 오프로딩 시 10–15 tok/s; 128 GB로 업그레이드하면 15–20 tok/s
- 7B Q4 속도: Ollama에서 ~105–125 tok/s
- 14B Q8 속도: ~48–60 tok/s
- 30B Q4 속도: ~28–38 tok/s
- 전력 소비: ~550 W 최대 (GPU 450 W + CPU 65 W + 나머지)
| 부품 | 모델 | 가격 (2026년 5월) |
|---|---|---|
| GPU | NVIDIA GeForce RTX 4090 24 GB | ~$1,650 |
| CPU | AMD Ryzen 9 9950X (16C/32T, Zen 5) | ~$420 |
| 마더보드 | ASUS ProArt X870E-Creator WiFi | ~$350 |
| RAM | 64 GB DDR5-6000 CL30 (2×32 GB) | ~$145 |
| 저장장치 | 4 TB PCIe Gen 5 NVMe | ~$200 |
| 파워 서플라이 | 1000 W 80+ Platinum 인증 | ~$150 |
| 케이스 | 풀타워 ATX, 좋은 기류 | ~$120 |
| CPU 쿨러 | 360mm AIO | ~$90 |
| 합계 | ~$3,125 |
3단계: $5,000 전문가형 70B 워크스테이션
$5,000 전문가형 빌드는 총 48 GB VRAM의 RTX 3090 두 개를 사용하여 70B 모델을 GPU 속도(25–40 tok/s)로 추론하는 것을 목표로 합니다. Ryzen Threadripper 7960X(24코어, 높은 메모리 대역폭)는 48 GB를 초과하는 모델의 CPU 오프로딩을 가속합니다. 256 GB DDR5로 양자화된 140B 모델도 완전히 RAM에 로드할 수 있습니다.
- 전체 GPU 속도로 지원되는 모델 (총 48 GB VRAM): 7B–70B Q4, 30B Q8
- 70B Q4 속도: 25–40 tok/s (Ollama 텐서 병렬 처리로 두 RTX 3090 모두 활성)
- 256 GB RAM으로 CPU 오프로딩: 140B+ 모델을 4–6 tok/s로 실행
- 듀얼 GPU 설정: Ollama가 두 GPU를 자동으로 감지합니다. NVLink 불필요
- 전력 소비: ~900 W 최대 (GPU 2× 700 W + CPU 350 W + 나머지)
- 권장 파워 서플라이: Seasonic PRIME TX-1600W 또는 동급
| 부품 | 모델 | 가격 (2026년 5월) |
|---|---|---|
| GPU ×2 | 2× NVIDIA RTX 3090 24 GB (중고) | ~$880 |
| CPU | AMD Ryzen Threadripper 7960X (24C) | ~$1,300 |
| 마더보드 | ASUS Pro WS TRX50-SAGE WiFi | ~$650 |
| RAM | 256 GB DDR5-5200 ECC (8×32 GB) | ~$650 |
| 저장장치 | 8 TB PCIe Gen 4 NVMe (2×4 TB) | ~$360 |
| 파워 서플라이 | 1600 W Platinum 모듈식 | ~$280 |
| 케이스 | 풀타워 HEDT ATX | ~$180 |
| CPU 쿨러 | 360mm AIO + 추가 팬 | ~$120 |
| GPU 브리지/케이블 | NVLink 불필요 (Ollama가 둘 다 사용) | ~$0 |
| 합계 | ~$4,420 |
모든 빌드를 위한 소프트웨어 스택
하드웨어 조립 후 Ollama를 시작하는 데 10분 미만이 소요됩니다:
- 1Ubuntu 22.04 LTS 또는 Windows 11 설치 (Ubuntu가 CUDA 안정성으로 선호됨)
- 2nvidia.com에서 또는
ubuntu-drivers autoinstall로 NVIDIA 드라이버 550+ 설치 - 3Ollama 설치:
curl -fsSL https://ollama.com/install.sh | sh - 4모델 다운로드:
ollama pull qwen2.5:14b-instruct-q8_0 - 5네트워크 서버로 실행:
OLLAMA_HOST=0.0.0.0 ollama serve - 6브라우저 인터페이스를 위해 Open WebUI 설치:
docker run -d -p 3000:8080 --gpus all ghcr.io/open-webui/open-webui:cuda - 7모든 기기에서 안전한 원격 접근을 위해 Tailscale 사용
세 빌드의 성능 비교
| 모델 + 양자화 | 경제형 ($1,200) | 추천형 ($2,500) | 전문가형 ($5,000) |
|---|---|---|---|
| Llama 3.3 8B Q4 | 55–70 tok/s | 105–125 tok/s | 120–140 tok/s |
| Qwen3 14B Q8 | 20–28 tok/s | 48–60 tok/s | 55–70 tok/s |
| Qwen3 32B Q4 | 12–18 tok/s | 28–38 tok/s | 40–55 tok/s |
| Llama 3.3 70B Q4 | 5–8 tok/s (CPU) | 10–15 tok/s (CPU) | 25–40 tok/s (GPU) |
| Mixtral 8x22B Q4 | 15–22 tok/s | 32–45 tok/s | 45–60 tok/s |
70B 모델 실행을 위해 워크스테이션을 만드는 것이 낫습니까, 클라우드에서 GPU를 빌리는 것이 낫습니까?
정기적인 사용(하루 2시간 이상)이라면 워크스테이션을 만드십시오. RunPod의 전용 A40 48 GB는 $0.44/h입니다 — 하루 4시간이면 연간 $641입니다. $3,000–4,000 전문가 빌드는 5–6년 후에 클라우드와 비교해 본전이 됩니다. 가끔 사용(하루 1시간 미만)이라면 클라우드가 더 경제적입니다. /ko/local-llms/local-llm-cost-calculator-build-vs-rent-2026에서 비용 계산기를 확인하십시오.
두 GPU에서 Ollama를 실행하기 위해 NVLink가 필요합니까?
아닙니다. Ollama는 CUDA 텐서 병렬 처리를 사용하여 PCIe를 통해 여러 GPU에 모델 레이어를 분산합니다 — NVLink가 필요 없습니다. NVLink는 GPU 간 대역폭을 ~32 GB/s(PCIe 4.0 x16)에서 ~600 GB/s로 높이지만, 이는 훈련에는 중요하지만 추론에는 중요하지 않습니다. 듀얼 RTX 3090 설정은 NVLink 없이 완벽하게 작동합니다.
전문가 빌드에서 단일 RTX 4090 대신 듀얼 RTX 3090을 사용하는 이유는 무엇입니까?
VRAM이 결정적 요소입니다. 두 RTX 3090 각 24 GB = 총 48 GB, Llama 3.3 70B Q4(~40 GB)에 충분합니다. 단일 RTX 4090은 24 GB만 있으므로 CPU 오프로딩 없이는 70B Q4 모델이 맞지 않습니다. GPU 속도로 70B 추론을 위해서는 듀얼 3090이 달러당 VRAM에서 앞섭니다. 30B 이하 모델에서는 RTX 4090이 달러당 더 빠릅니다.
경제형 빌드에서 시작하여 추천형으로 업그레이드할 수 있습니까?
예 — 세 빌드 모두 AM5 소켓(1, 2단계) 또는 TRX50(3단계)을 사용합니다. 나중에 RTX 3090을 RTX 4090으로 교체하거나 두 번째 GPU를 추가할 수 있습니다. RAM 모듈은 호환됩니다. 유일한 비호환성은 1/2단계(AM5)와 3단계(TRX50) 사이입니다 — Threadripper로 전환하려면 새 마더보드와 CPU가 필요합니다.
전문가 빌드에는 어떤 전원 콘센트가 필요합니까?
전문가 빌드(듀얼 RTX 3090 + Threadripper)는 콘센트에서 최대 ~900 W를 소비합니다. 미국 표준 15A/120V 콘센트는 ~1,800 W를 지원합니다 — 충분합니다. 유럽 16A/230V 콘센트는 ~3,680 W를 지원합니다. 열과 전력 소비를 최소화하기 위해 80+ Platinum 효율의 고품질 파워 서플라이(Seasonic, Corsair, be quiet!)를 사용하십시오.
관련 읽기
- 로컬 LLM 최적 GPU 구매 가이드 2026 -- 각 워크스테이션 단계별 GPU 구매 가이드
- 저사양 PC 최고의 로컬 AI 앱 -- 풀 워크스테이션 준비가 되지 않은 경우 소프트웨어 선택지
- 로컬 AI를 위한 최고의 Mac 2026 -- GPU 워크스테이션의 Apple Silicon 대안
- 로컬 LLM 실행을 위한 최고의 노트북: 2026년 구매 가이드 -- 워크스테이션 빌드를 결정하기 전 휴대용 선택지
- Qwen 로컬 배포 완전 가이드 2026: 프로덕션 서버 구축 -- 워크스테이션 구축 후 프로덕션 배포
