핵심 요점
- 홈 제어는 최대 모델 크기가 아닌 낮은 지연 시간과 신뢰할 수 있는 함수 호출을 필요로 합니다
- 4B 모델은 저전력 하드웨어에 적합하고 8B 모델은 GPU 또는 NPU가 있는 미니 PC에 적합합니다
- Gemma 3 4B (Google), Qwen3 4B (Alibaba), Qwen3 8B (Alibaba)가 일반적이고 잘 지원되는 선택입니다
- Qwen3, Gemma 3, Phi-4-mini는 현재 Home Assistant 툴 호출 지원이 검증되어 있습니다
- 사용하는 언어를 강하게 지원하는 모델을 선택하십시오
- 깊은 모델 순위와 메커니즘은 local-llms 클러스터로 연결하십시오
홈 제어에 중요한 것
좋은 홈 제어 모델을 결정하는 세 가지: 지연 시간, 신뢰할 수 있는 함수 호출, 하드웨어에 맞는 크기입니다. 벤치마크 리더보드는 반응성보다 훨씬 덜 중요합니다.
- 지연 시간: 음성 명령이 거의 즉각적으로 느껴져야 합니다. 고성능 하드웨어의 소형 모델이 더 빠르게 응답합니다.
- 함수 호출: 모델이 구조화된 장치 동작을 안정적으로 출력해야 합니다. 이것이 결정적인 능력입니다.
- 적합성: 모델이 Home Assistant를 호스팅하는 기기에서 편안하게 실행되어야 합니다. 로컬 스마트 홈을 위한 최고의 하드웨어를 참조하십시오.
단축 목록
이 소형 모델들은 다양한 하드웨어 예산에서 홈 제어에 일반적이고 잘 지원되는 선택입니다. 경량 하드웨어에는 4B 모델을, GPU 또는 NPU가 있을 때는 8B 모델을 사용하십시오. Gemma 4 (2026년 6월)가 최신 옵션입니다. Qwen3, Gemma 3, Phi-4-mini는 현재 Home Assistant 툴 호출 지원이 검증되어 있습니다.
- Gemma 3 4B (Google): 광범위한 다국어 지원(140개 이상 언어)을 갖춘 40억 매개변수 모델로 강력한 저전력 선택입니다 — Ollama 태그
gemma3:4b. - Qwen3 4B (Alibaba): 신뢰할 수 있는 툴 사용과 우수한 다국어 지원을 갖춘 빠른 4B 모델로 CPU 또는 내장 GPU에서 낮은 지연 시간 —
qwen3:4b. - Phi-4-mini (Microsoft): 명령 이행에서 크기 이상의 성능을 발휘하는 컴팩트한 3.8B 모델 —
phi4-mini. - Llama 3.2 3B (Meta): 우수한 함수 호출로 평범한 하드웨어에서 실행되는 광범위하게 지원되는 3B 기준 모델 —
llama3.2:3b. - Qwen3 8B (Alibaba): GPU 또는 NPU에서 최고의 품질, Home Assistant 툴 호출의 선호 모델 —
qwen3:8b.
비교
하드웨어와 언어로 선택하십시오: CPU 전용 또는 Pi급 하드웨어에는 소형 모델, GPU 탑재 미니 PC에는 8B. 아래 크기는 일반적인 4비트 양자화에서 근사치입니다. Ollama 태그가 다운로드할 정확한 모델입니다.
- 풋프린트는 근사치이며 양자화에 따라 달라집니다. VRAM 및 양자화 심도는 local-llms 클러스터로 연결하십시오.
| 모델 | 매개변수 | 근사 풋프린트 (Q4) | Ollama 태그 | 최적 용도 |
|---|---|---|---|---|
| Gemma 3 4B | 4B | ~3 GB | gemma3:4b | 저전력 호스트, 140개 이상 언어 |
| Qwen3 4B | 4B | ~2.5–3 GB | qwen3:4b | 낮은 지연 시간, 다국어, 툴 |
| Phi-4-mini | 3.8B | ~2.5–3 GB | phi4-mini | 강력한 명령 이행 |
| Llama 3.2 3B | 3B | ~2–3 GB | llama3.2:3b | 광범위하게 지원되는 기준 모델 |
| Qwen3 8B | 8B | ~5 GB | qwen3:8b | GPU/NPU에서 최고 품질; HA 선호 모델 |
하드웨어 예산별 선택
Pi 또는 CPU 전용 미니 PC에는 4B 모델, GPU 또는 NPU가 있을 때는 8B 모델을 선택하십시오. 이렇게 하면 모든 계층에서 응답이 빠릅니다.
- Raspberry Pi / 저전력: 더 느린 응답을 감수하고 Gemma 3 4B 또는 Qwen3 4B.
- 미니 PC (CPU 전용): 반응이 빠른 기본값으로 Qwen3 4B 또는 Phi-4-mini.
- GPU/NPU 탑재 미니 PC: 허용 가능한 지연 시간으로 최고의 품질을 위해 Qwen3 8B — Home Assistant + 로컬 AI를 위한 최고의 미니 PC를 참조하십시오.
선택 방법
4B 모델로 시작하여 지연 시간과 신뢰할 수 있는 장치 동작을 확인하고, 품질이 부족한 경우에만 8B로 전환하십시오. 결정하기 전에 실제 명령으로 테스트하십시오.
- Ollama 통합을 통해 설치하고 일반적인 명령을 테스트하십시오.
- 응답이 느리면 크기를 줄이거나 GPU/NPU를 추가하십시오.
- 동작이 불안정하면 함수 호출로 알려진 모델을 선호하십시오.
- 깊은 모델 순위와 메커니즘은 최고의 로컬 LLM 2026(크로스 클러스터)를 참조하십시오. 이 가이드는 홈 제어 특화입니다.
자주 묻는 질문
홈 제어에 사용 가능한 가장 소형 모델은 무엇입니까?
Llama 3.2 3B 같은 3B 모델은 저전력 하드웨어에서 신뢰할 수 있는 장치 제어를 위한 실용적인 최저선입니다. 일부 이해력을 속도와 교환합니다. 하드웨어가 허용한다면 Gemma 3 4B나 Qwen3 4B 같은 4B 모델이 더 나은 균형입니다.
홈 제어 모델에 GPU가 필요합니까?
CPU 또는 내장 GPU에서 실행되는 4B 모델에는 필요하지 않습니다. GPU 또는 NPU는 주로 더 나은 이해를 위해 낮은 지연 시간으로 Qwen3 8B 같은 8B 모델을 실행할 수 있게 합니다. 하드웨어에 맞는 모델을 선택하십시오.
어떤 모델이 함수 호출을 지원합니까?
Qwen3, Gemma 3, Phi-4-mini를 포함한 현대 소형 모델은 신뢰할 수 있는 장치 동작을 출력할 수 있는 능력인 Home Assistant 툴/함수 호출 지원이 검증되어 있습니다. 홈 제어에는 이를 지원하는 것으로 문서화된 모델을 선호하십시오.
Raspberry Pi에 가장 적합한 모델은 무엇입니까?
Gemma 3 4B나 Qwen3 4B 같은 4B 모델이 Raspberry Pi의 실용적인 상한선이며 응답이 미니 PC보다 느립니다. 빠른 어시스턴트를 원한다면 GPU/NPU로 Qwen3 8B를 실행하는 미니 PC가 더 나은 호스트입니다.
