실제 사용 스택
9개 카테고리 전체를 읽고 싶지 않은 독자를 위해 가장 가까운 스택을 선택하고 복사하십시오. 각 행은 실제 목표를 검증된 조합 및 실제로 작동하는 최소 하드웨어와 연결합니다.
목표 | 스택 | 최소 하드웨어 |
|---|---|---|
| 일상적인 채팅 | LM Studio 단독 | 16 GB RAM, GPU 불필요 |
| 파워유저를 위한 최고의 균형 | Ollama + Open WebUI | 16 GB RAM, GPU 선택사항 |
| 문서 채팅 | Ollama + AnythingLLM | 16 GB RAM, GPU 선택사항 |
| 코딩 | Ollama + Continue.dev | 16 GB RAM + GPU 권장 |
| 롤플레이 / 창작 | KoboldCpp + SillyTavern | 16 GB RAM, GPU 권장 |
| 프라이버시 우선 기업 | Ollama + Open WebUI + PrivateGPT | 32 GB RAM + 12 GB VRAM |
| 모바일 / 이동 중 | MLC Chat 또는 PocketPal AI | iPhone 13+ / Pixel 7+ |
| Apple Silicon | Ollama (MLX 백엔드) 또는 LM Studio | M2/M3/M4/M5 16 GB+ 통합 메모리 |
| 멀티유저 팀 | vLLM + Open WebUI | 32 GB+ RAM + 멀티 GPU |
핵심 요점
- 10개 레이어, 160+개 프로젝트, 하나의 지도. 런타임, 데스크톱 앱, 웹 UI, IDE 통합, 터미널 도구, RAG 시스템, 에이전트 프레임워크, 음성/오디오/비전, 모바일 클라이언트, 전문 생산성 플러그인, 이미지 생성 — 2026년의 거의 모든 인기 프로젝트는 정확히 하나의 레이어에 속합니다.
- 먼저 런타임을 선택하십시오. Ollama는 독자의 ~95%에게 적합한 기본 선택입니다. llama.cpp는 대부분의 다른 도구 뒤에 있는 기반 엔진이며, vLLM은 실제 GPU에서 멀티유저 배포 시 프로덕션 선택입니다.
- 런타임 위의 대부분 레이어는 선택적입니다. 채팅에는 데스크톱 앱 OR 웹 UI 하나로 충분합니다. 코드 지원이 필요할 때만 IDE 통합을, CLI 워크플로가 필요할 때만 터미널 도구를, 자신의 문서와 대화할 때만 RAG 시스템을, 단일 단계 호출로 충분하지 않을 때만 에이전트 프레임워크를, 시각적 출력이 필요할 때만 이미지 생성을 추가하십시오.
- 상업적 사용 시 라이선스가 중요합니다. MIT와 Apache 2.0이 생태계를 지배합니다. AGPL은 일부 인터페이스(text-generation-webui, KoboldCpp, Jan, SillyTavern)에 적용됩니다 — 개인 사용에는 적합하지만 상업적 배포 시에는 더 신중하게 검토해야 합니다.
- 멀티툴 스택이 일반적입니다. Ollama + Open WebUI + AnythingLLM + Continue.dev + Stable Diffusion은 채팅, RAG, 코딩, 이미지 생성을 타협 없이 커버하는 단일 머신 구성입니다. 아래의 "실제 사용 스택" 표에 2026년에 실제로 작동하는 레시피가 나열되어 있습니다.
📍 한 문장으로
2026년 로컬 LLM 생태계는 런타임, 데스크톱 앱, 웹 UI, IDE 통합, 터미널 도구, RAG 시스템, 에이전트 프레임워크, 음성/오디오/비전, 모바일 클라이언트, 전문 도구, 이미지 생성의 10개 레이어에 걸쳐 160개 이상의 활성 프로젝트를 보유하고 있습니다.
💬 쉽게 말하면
로컬 LLM 소프트웨어는 인터넷 없이 개인 컴퓨터에서 AI를 실행하는 도구입니다. Ollama 같은 런타임이 모델을 로드하고, LM Studio 같은 앱이 채팅 화면을 제공하며, AnythingLLM 같은 도구는 사용자 문서를 참조할 수 있게 합니다.
이 디렉토리를 최신 상태로 유지하는 방법
이 디렉토리는 6개월마다 검토되며 검토 사이에도 수시로 패치됩니다 — 2026년 8월 마지막 업데이트, 다음 정기 검토는 2026년 11월 예정입니다. 2026년 8월 확장에서는 모든 계층에 72개 이상의 신규 도구를 추가하고, 음성/멀티모달을 STT·TTS·비전의 세 가지 전문 계층으로 분리했으며, 코딩 어시스턴트를 IDE 연동(4a)과 터미널 도구(4b)로 분리하고, 완전히 새로운 이미지 생성 계층을 추가했습니다. 모든 링크와 라이선스를 재검증했으며, 신규 항목(PearAI, Windsurf, Sourcegraph Cody, SuperAGI, Leon AI, Draw Things, Fooocus, StableSwarmUI 등)이 활발히 유지 관리되고 있는지 확인했습니다. 포함 기준: 프로젝트가 활발히 유지 관리되고(최근 90일 내 커밋), 검증 가능한 오픈소스 라이선스 또는 명확한 상업적 사용 선언이 있으며, 2026년 기준으로 상당한 사용자 기반을 보유하거나 그렇지 않으면 비어 있을 계층을 채웁니다. 두 릴리스 주기 이상 비활성화된 프로젝트는 제거되며, 기준을 충족하는 신규 프로젝트는 다음 검토 시 추가됩니다. 포함을 위한 프로젝트 제안은 PromptQuorum 저장소에 이슈 또는 PR을 열어주십시오 — 프로젝트 URL, 라이선스, 위의 형식으로 한 문장 설명을 포함하십시오.
출처
- ggml-org/llama.cpp GitHub — 런타임 아키텍처 및 지원 모델에 대한 기본 출처.
- Ollama Library — 공식 모델 카탈로그 및 런타임 문서.
- LM Studio Documentation — 주요 데스크톱 GUI의 기능 참조.
- Open WebUI Documentation — 주요 셀프호스팅 웹 인터페이스의 기능 참조.
- Hugging Face Hub — 위에 나열된 각 런타임이 사용하는 모델 가중치를 다운로드하는 기본 위치.
- awesome-local-llm GitHub list — 프로젝트 포함 확인에 사용된 커뮤니티 유지 인벤토리.
자주 묻는 질문
로컬 LLM 런타임과 데스크톱 앱의 차이는 무엇입니까?
런타임(Ollama, llama.cpp, vLLM)은 모델 가중치를 로드하고 API(보통 OpenAI 호환)를 제공하는 엔진입니다. 데스크톱 앱(LM Studio, Jan, GPT4All)은 런타임을 백그라운드에서 호출하는 채팅 인터페이스입니다. 일부 앱은 자체 런타임을 포함합니다(LM Studio는 llama.cpp를 내장). 다른 앱은 별도 런타임 설치가 필요합니다(Open WebUI는 Ollama를 호출). 런타임은 가능한 것을 결정하고, 앱은 편리한 것을 결정합니다.
이 목록에서 여러 도구를 동시에 사용할 수 있습니까?
네 — 대부분의 스택은 2-4개의 도구를 결합합니다. 일반적인 구성: Ollama를 런타임으로, Open WebUI를 채팅용으로, AnythingLLM을 문서 채팅용으로, Continue.dev를 코딩용으로 — 4개 모두 단일 머신의 동일한 Ollama 인스턴스와 함께 작동합니다. 위의 "실제 사용 스택" 표에는 충돌 없이 작동하는 레시피가 나열되어 있습니다.
텔레메트리 없이 완전 오프라인으로 작동하는 도구는 무엇입니까?
Ollama, llama.cpp, vLLM, Jan, GPT4All, Open WebUI, AnythingLLM, PrivateGPT, Continue.dev, Aider, KoboldCpp, Llamafile, MLX-LM 및 이 디렉토리의 대부분 AGPL/MIT 라이선스 앱은 모델이 다운로드되면 완전 오프라인으로 작동합니다. LM Studio와 일부 비공개 소스 도구는 설정에서 비활성화할 수 있는 선택적 분석 기능이 있습니다 — 설치 후 한 번 패킷 캡처로 확인하십시오. 웹 인터페이스(Open WebUI, LibreChat)는 로컬 백엔드를 사용하도록 구성된 경우에만 로컬입니다.
이 도구 중 일부는 상업적 라이선스(상업적 사용에 무료가 아닌)가 있습니까?
일부 있습니다: LM Studio, Msty, Backyard AI, Layla, Cursor는 비공개 소스 — 일반적으로 사용하기 무료이지만 재배포할 수 없으며 상업적 약관은 다릅니다. Private LLM은 유료입니다. AGPL 라이선스 도구(Jan, KoboldCpp, text-generation-webui, SillyTavern, Khoj, Copilot for Obsidian)는 상업적 사용을 포함한 모든 사용에 무료이지만 AGPL 약관은 수정하여 공개적으로 호스팅할 경우 소스 코드 공개를 요구합니다. Apache 2.0 및 MIT 프로젝트(대부분)는 라이선스 텍스트 이상의 귀속 제한 없이 상업적 맥락을 포함한 모든 맥락에서 사용 가능합니다.
네이티브로 Apple Silicon(M 시리즈 칩)을 지원하는 도구는 무엇입니까?
Ollama, llama.cpp, MLX-LM, LM Studio, Jan, Enchanted, GPT4All, MLC Chat, AnythingLLM 및 대부분의 Electron/Tauri 앱은 Apple Silicon에서 네이티브로 작동하며 Metal 백엔드를 사용합니다. MLX-LM은 Apple 전용이며 M 시리즈 칩의 대형 모델에 가장 빠릅니다. vLLM, TensorRT-LLM, ExLlamaV2는 NVIDIA 중심이며 Apple Silicon에서 작동하지 않거나 제대로 작동하지 않습니다 — Apple 사용자에게는 Metal 백엔드가 있는 Ollama가 기본 선택입니다.
이 도구들은 모두 GGUF 모델 형식을 지원합니까?
GGUF는 llama.cpp와 이를 감싸는 모든 도구(Ollama, LM Studio, Jan, GPT4All, KoboldCpp, Llamafile)의 네이티브 형식입니다. vLLM과 TensorRT-LLM은 더 나은 성능을 위해 자체 최적화 형식(보통 AWQ 또는 FP16)을 사용합니다. ExLlamaV2는 EXL2 양자화를 사용합니다. MLX-LM은 MLX로 변환된 가중치를 사용합니다. 나열된 대부분의 도구는 GGUF를 허용합니다. 일부(vLLM, TensorRT-LLM, ExLlamaV2, MLX-LM)는 원본 Hugging Face 가중치에서 일회성 변환 단계가 필요합니다.
코딩 경험이 없는 사용자에게 가장 좋은 도구는 무엇입니까?
GPT4All은 가장 간단한 설치(원클릭, 8 GB RAM으로 작동)를 제공합니다. LM Studio는 터미널 없이 가장 풍부한 기능을 제공합니다. Jan은 코딩 없이 가장 프라이버시 중심의 선택입니다. 명령줄 작업 없이 문서 채팅을 원한다면 AnythingLLM이 가장 쉽습니다. 네 가지 모두 위의 데스크톱 앱(GUI) 카테고리에 나열되어 있습니다.
이 도구들을 서버에서 실행하고 원격으로 접근할 수 있습니까?
서버 기능이 있는 대부분의 도구(Ollama, vLLM, LocalAI, Open WebUI, LibreChat, PrivateGPT, AnythingLLM)는 HTTP API를 노출하고 설정에서 구성 가능한 네트워크 인터페이스에 바인딩됩니다. 표준 패턴: 홈 서버나 VPS에서 Ollama를 실행하고, 서버 IP를 가리키는 랩톱이나 폰에서 인터페이스를 실행합니다. API를 다른 웹 서비스처럼 취급하십시오 — 역방향 프록시 뒤의 localhost에 바인딩하거나 적절한 인증이 있는 사설 네트워크에 바인딩합니다. Open WebUI는 멀티유저 지원을 기본으로 포함합니다.
멀티유저 / 팀 설정을 지원하는 도구는 무엇입니까?
Open WebUI, LibreChat, h2oGPT, AnythingLLM(관리자 기능 활성화 시), Dify는 역할 기반 접근 제어 및 사용자별 대화 기록이 있는 멀티유저 사용을 위해 설계되었습니다. vLLM은 동시 추론이 중요할 때 하부의 올바른 서빙 레이어입니다 — ~3 이상의 동시성에서 Ollama로는 달성할 수 없는 성능을 위해 여러 사용자의 요청을 배치 처리합니다.
이 디렉토리는 얼마나 자주 업데이트됩니까?
6개월마다 — 2026년 8월 마지막 업데이트, 다음 예정 검토는 2026년 11월입니다. 중간 변경사항(프로젝트가 비활성화, 새 도구가 상당한 점유율을 획득, 라이선스 변경)은 기존 항목에 패치로 적용됩니다. 완전히 새로운 카테고리나 레이어(2026년 8월의 이미지 생성 계층 추가와 같은)는 구조를 안정적으로 유지하기 위해 정기 검토 시점에 추가됩니다. 위의 "출처" 섹션에는 검토 사이에 생태계 동향을 모니터링하는 데 사용되는 커뮤니티 인덱스가 나열되어 있습니다.
클라우드 호출 없이 로컬에서 이미지 생성을 할 수 있습니까?
네 — Stable Diffusion, ComfyUI, Invoke AI, AUTOMATIC1111 WebUI 등 10번 계층에 속한 도구들은 모두 로컬 하드웨어에서 완전히 동작합니다. Stable Diffusion은 6 GB 이상의 VRAM(RTX 3060, RTX 4060 또는 동급)이 필요하며, Fooocus를 비롯한 최적화된 UI는 4-6 GB급 카드에서도 동작합니다. Real-ESRGAN은 생성된 이미지를 업스케일하고, ControlNet은 공간적 제어(윤곽선, 포즈, 깊이 맵)를 추가하며, AnimateDiff는 텍스트로부터 영상을 생성합니다. 모두 데이터를 외부 서버로 전송하지 않고 동작합니다.