핵심 요점
- 9개 레이어, 88개 프로젝트, 하나의 지도. 런타임, 데스크톱 앱, 웹 UI, 코딩 어시스턴트, RAG 시스템, 에이전트 프레임워크, 음성/멀티모달, 모바일 클라이언트, 전문 생산성 플러그인 — 2026년의 거의 모든 인기 프로젝트는 정확히 하나의 레이어에 속합니다.
- 먼저 런타임을 선택하십시오. Ollama는 독자의 ~95%에게 적합한 기본 선택입니다. llama.cpp는 대부분의 다른 도구 뒤에 있는 기반 엔진이며, vLLM은 실제 GPU에서 멀티유저 배포 시 프로덕션 선택입니다.
- 런타임 위의 대부분 레이어는 선택적입니다. 채팅에는 데스크톱 앱 OR 웹 UI 하나로 충분합니다. IDE 연동이 필요할 때만 코딩 어시스턴트를 추가하고, 자신의 문서와 대화할 때만 RAG 시스템을, 단일 단계 호출로 충분하지 않을 때만 에이전트 프레임워크를 추가하십시오.
- 상업적 사용 시 라이선스가 중요합니다. MIT와 Apache 2.0이 생태계를 지배합니다. AGPL은 일부 인터페이스(text-generation-webui, KoboldCpp, Jan, SillyTavern)에 적용됩니다 — 개인 사용에는 적합하지만 상업적 배포 시에는 더 신중하게 검토해야 합니다.
- 멀티툴 스택이 일반적입니다. Ollama + Open WebUI + AnythingLLM + Continue.dev는 채팅, RAG, 코딩을 타협 없이 커버하는 단일 머신 구성입니다. 아래의 "실제 사용 스택" 표에 2026년에 실제로 작동하는 레시피가 나열되어 있습니다.
📍 한 문장으로
2026년 로컬 LLM 생태계는 런타임, 데스크톱 앱, 웹 UI, 코딩 어시스턴트, RAG 시스템, 에이전트 프레임워크, 음성/멀티모달, 모바일 클라이언트, 전문 도구의 9개 레이어에 걸쳐 88개의 활성 프로젝트를 보유하고 있습니다.
💬 쉽게 말하면
로컬 LLM 소프트웨어는 인터넷 없이 개인 컴퓨터에서 AI를 실행하는 도구입니다. Ollama 같은 런타임이 모델을 로드하고, LM Studio 같은 앱이 채팅 화면을 제공하며, AnythingLLM 같은 도구는 사용자 문서를 참조할 수 있게 합니다.
1. 로컬 LLM 런타임 및 추론 엔진
런타임은 모델 가중치를 메모리에 로드하고 프롬프트를 토큰으로 변환하는 엔진입니다. 로컬 LLM 스택에서 첫 번째 결정이며 그 위의 모든 것을 결정합니다 — 데스크톱 앱, 웹 UI, 코딩 어시스턴트는 모두 결국 런타임을 호출합니다. Ollama는 2026년 사용자 지향 시장 점유율을 지배합니다. OpenAI 호환 API와 단일 명령 설치를 제공하기 때문입니다. llama.cpp는 대부분의 다른 도구 기반에 있는 C++ 엔진이며, vLLM은 실제 GPU에서 동시 사용자를 서비스해야 할 때 적합한 선택입니다.
| 도구 | 링크 | 설명 | 라이선스 |
|---|---|---|---|
| Ollama | ollama.com | 전반적으로 가장 쉬운 — 단일 명령 설치, OpenAI 호환 API, 대형 모델 라이브러리 | MIT |
| llama.cpp | github.com/ggml-org/llama.cpp | 대부분의 다른 도구 기반에 있는 C++ 엔진, Apple Silicon 포함 어디서나 동작 | MIT |
| vLLM | github.com/vllm-project/vllm | 멀티유저 GPU 배포를 위한 고성능 서빙 | Apache 2.0 |
| LocalAI | localai.io | 여러 백엔드를 지원하는 OpenAI API 드롭인 대체 | MIT |
| TensorRT-LLM | github.com/NVIDIA/TensorRT-LLM | 엔터프라이즈 GPU 구성을 위한 NVIDIA 최적화 추론 | Apache 2.0 |
| MLC LLM | mlc.ai/mlc-llm | 모바일 및 엣지 디바이스용 배포 런타임 | Apache 2.0 |
| SGLang | github.com/sgl-project/sglang | 에이전트 파이프라인을 위한 구조화 추론 서빙 | Apache 2.0 |
| ExLlamaV2 | github.com/turboderp-org/exllamav2 | RTX GPU에 최적화된 빠른 양자화 추론 | MIT |
| KoboldCpp | github.com/LostRuins/koboldcpp | 내장 인터페이스가 포함된 llama.cpp 경량 래퍼 | AGPL 3.0 |
| Llamafile | github.com/Mozilla-Ocho/llamafile | Mozilla의 단일 파일 포터블 LLM 실행 | Apache 2.0 |
| MLX-LM | github.com/ml-explore/mlx-examples | Apple Research의 Apple Silicon 네이티브 런타임 | MIT |
상세 비교 가이드: llama.cpp vs Ollama vs vLLM
2. 데스크톱 앱 (GUI)
데스크톱 앱은 런타임을 채팅 인터페이스와 모델 탐색기로 감쌉니다. 터미널 단계가 없기 때문에 대부분의 비기술적 사용자가 시작하는 곳입니다 — 다운로드, 클릭, 채팅. LM Studio, Jan, GPT4All이 2026년 사용자 기반의 대부분을 차지합니다. AnythingLLM은 데스크톱 앱이자 RAG 레이어로도 기능하며, Open Interpreter는 로컬 모델이 컴퓨터를 제어하도록 허용하는 특수한 경우입니다.
| 도구 | 링크 | 설명 | 라이선스 |
|---|---|---|---|
| LM Studio | lmstudio.ai | 가장 세련된 GUI, HuggingFace 모델 탐색기 내장, 서버 모드 | 무료(비공개) |
| Atomic Chat | atomic.chat | 데스크톱과 모바일용 오프라인 채팅 앱, 원클릭으로 로컬 에이전트 실행 | Apache 2.0 |
| Jan | jan.ai | 프라이버시 중심의 오프라인 ChatGPT 클론, 완전 오픈소스 | AGPL 3.0 |
| GPT4All | nomic.ai/gpt4all | 강력한 CPU 전용 지원을 갖춘 입문자 친화적 앱 | MIT |
| AnythingLLM | anythingllm.com | 내장 벡터 저장소를 갖춘 RAG 및 문서 채팅 | MIT |
| Msty | msty.app | 깔끔한 소비자 UX, 멀티 제공자 지원 | 무료(비공개) |
| Cherry Studio | cherry-ai.com | 광범위한 커스터마이징을 갖춘 멀티 제공자 데스크톱 AI | AGPL 3.0 |
| Backyard AI | backyard.ai | 캐릭터 채팅 및 롤플레이용 데스크톱 클라이언트 | 무료(비공개) |
| Enchanted | github.com/AugustDev/enchanted | 최소한의 macOS/iOS 네이티브 Ollama 클라이언트 | Apache 2.0 |
| h2oGPT | github.com/h2oai/h2ogpt | 많은 엔터프라이즈 기능을 갖춘 데스크톱 및 서버 | Apache 2.0 |
| Open Interpreter | github.com/OpenInterpreter/open-interpreter | 로컬 LLM이 컴퓨터를 제어하고 코드를 실행하도록 허용 | AGPL 3.0 |
상세 비교 가이드: LM Studio vs Jan vs GPT4All
3. 웹 UI 및 브라우저 프런트엔드
웹 UI는 셀프호스팅 ChatGPT 클론입니다 — 동일한 대화 인터페이스지만, 직접 소유한 머신이나 LAN에서 실행되는 런타임을 가리킵니다. 랩톱, 폰, 태블릿이 서버를 가리키는 멀티디바이스 접근이나 팀 사용에 자연스러운 선택입니다. Open WebUI는 2026년 셀프호스팅 세그먼트를 지배하며, LibreChat은 팀 기능 대안, SillyTavern은 전용 롤플레이 인터페이스입니다.
| 도구 | 링크 | 설명 | 라이선스 |
|---|---|---|---|
| Open WebUI | openwebui.com | 가장 인기 있는 ChatGPT 스타일 셀프호스팅 인터페이스, RAG 내장 | BSD 3-Clause |
| LibreChat | librechat.ai | 팀 기능을 갖춘 멀티모델 ChatGPT 대안 | MIT |
| text-generation-webui | github.com/oobabooga/text-generation-webui | 방대한 플러그인 생태계를 갖춘 파워유저용 인터페이스 | AGPL 3.0 |
| SillyTavern | github.com/SillyTavern/SillyTavern | 로어북이 있는 롤플레이 및 캐릭터 채팅 | AGPL 3.0 |
| LobeChat | lobehub.com | 플러그인 마켓플레이스가 있는 현대적이고 세련된 인터페이스 | MIT |
| Big-AGI | github.com/enricoros/big-AGI | 페르소나가 있는 고급 멀티 제공자 프런트엔드 | MIT |
| NextChat | github.com/ChatGPTNextWeb/NextChat | 간단한 배포가 가능한 경량 웹 채팅 | MIT |
| Page Assist | github.com/n4ze3m/page-assist | Chrome 및 Firefox용 브라우저 사이드바 AI | MIT |
| Chatbox | chatboxai.app | 크로스플랫폼 데스크톱 및 웹 클라이언트 | GPLv3 |
상세 비교 가이드: SillyTavern vs Agnai vs RisuAI
4. 코딩 어시스턴트 및 IDE 연동
코딩 어시스턴트는 OpenAI 호환 API를 통해 로컬 LLM을 편집기나 터미널에 연결합니다. 선택은 주로 워크플로에 따라 달라집니다: 편집기 내 자동 완성(Continue.dev), 자율 에이전트 편집(Cline, OpenHands), 또는 터미널에서 git 네이티브 diff 편집(Aider). 세 패턴 모두 OpenAI Chat Completions 프로토콜을 지원하는 런타임에서 작동합니다 — 2026년에는 Ollama가 가장 일반적인 백엔드입니다.
| 도구 | 링크 | 설명 | 라이선스 |
|---|---|---|---|
| Continue.dev | continue.dev | 로컬 모델로 VS Code 및 JetBrains에서 자동 완성 및 채팅 | Apache 2.0 |
| Aider | aider.chat | 멀티파일 편집 지원을 갖춘 터미널 페어 프로그래머 | Apache 2.0 |
| Cline | cline.bot | VS Code용 자율 코드 에이전트 | Apache 2.0 |
| Tabby | tabby.tabbyml.com | GitHub Copilot의 셀프호스팅 대안 | Apache 2.0 |
| CodeGPT | codegpt.co | 여러 편집기를 위한 IDE 연동 | MIT |
| OpenHands | github.com/All-Hands-AI/OpenHands | AI 소프트웨어 개발 에이전트 (이전 이름: OpenDevin) | MIT |
| Cursor (로컬 모드) | cursor.com | 로컬 모델 지원을 갖춘 AI 중심 코드 편집기 | 무료(비공개) |
| Twinny | github.com/twinnydotdev/twinny | VS Code용 무료 Copilot 대안 | MIT |
상세 비교 가이드: Continue.dev vs Cline vs Aider
5. RAG 시스템 및 문서 채팅
RAG (Retrieval-Augmented Generation) 시스템은 로컬 LLM을 임베딩 모델 및 벡터 저장소와 결합하여 모델이 사용자 자신의 문서에서 답변할 수 있게 합니다.** "그냥 작동하는" 턴키 앱(AnythingLLM, PrivateGPT, Quivr, Khoj)과 구축의 기반이 되는 프레임워크 라이브러리(LlamaIndex, Haystack, txtai)로 나뉩니다. RAGFlow는 특히 고품질 인용 추출이 필요한 문서에 대해 2026년에 점유율을 늘리고 있습니다.
| 도구 | 링크 | 설명 | 라이선스 |
|---|---|---|---|
| AnythingLLM | anythingllm.com | 워크스페이스가 있는 가장 쉬운 올인원 개인 RAG | MIT |
| PrivateGPT | github.com/zylon-ai/private-gpt | 기업 지향의 완전 오프라인 RAG | Apache 2.0 |
| Quivr | github.com/QuivrHQ/quivr | 셀프호스팅 개인 지식 어시스턴트 | Apache 2.0 |
| Khoj | khoj.dev | Obsidian 및 Notion과 동기화되는 개인 AI 제2의 뇌 | AGPL 3.0 |
| Dify | dify.ai | RAG 및 에이전트 지원을 갖춘 AI 워크플로 빌더 | Modified Apache 2.0 |
| Flowise | flowiseai.com | 시각적 LangChain 워크플로 빌더 | Apache 2.0 |
| Langflow | langflow.org | RAG 컴포넌트를 갖춘 시각적 AI 오케스트레이션 | MIT |
| LlamaIndex | llamaindex.ai | RAG 프레임워크 / Python 라이브러리 — 맞춤형 개발의 기반 | MIT |
| Haystack | haystack.deepset.ai | deepset의 검색 및 RAG 프레임워크 | Apache 2.0 |
| RAGFlow | ragflow.io | 인용 추출 기능이 있는 문서 심층 이해 RAG | Apache 2.0 |
| txtai | github.com/neuml/txtai | 단일 라이브러리에 통합된 벡터 데이터베이스 + LLM | Apache 2.0 |
상세 비교 가이드: AnythingLLM vs PrivateGPT vs Open WebUI
6. 에이전트 프레임워크 및 오케스트레이션
에이전트 프레임워크는 LLM에 대한 단일 단계 호출을 멀티스텝 워크플로(계획, 행동, 관찰, 반복)로 전환합니다. LangChain은 여전히 범용 표준입니다. CrewAI와 AutoGen은 역할 기반 멀티에이전트 설정에 특화되어 있습니다. LangGraph는 장기 실행 흐름에서 상태 관리가 중요할 때 올바른 선택입니다. 아래 8개 프레임워크 모두 Ollama 로컬 백엔드와 원활하게 작동합니다.
| 도구 | 링크 | 설명 | 라이선스 |
|---|---|---|---|
| LangChain | langchain.com | 범용 LLM 애플리케이션 프레임워크 | MIT |
| LlamaIndex | llamaindex.ai | RAG 중심의 에이전트 및 데이터 프레임워크 | MIT |
| CrewAI | crewai.com | 역할 기반 멀티에이전트 워크플로 | MIT |
| AutoGen | github.com/microsoft/autogen | Microsoft의 멀티에이전트 오케스트레이션 프레임워크 | CC-BY-4.0 / MIT |
| Semantic Kernel | learn.microsoft.com/semantic-kernel | C#/Python/Java용 Microsoft 엔터프라이즈 오케스트레이션 SDK | MIT |
| LangGraph | langchain-ai.github.io/langgraph | 상태를 갖춘 그래프 기반 에이전트 워크플로 | MIT |
| Letta (이전 이름: MemGPT) | letta.com | 장기 기억을 갖춘 에이전트 | Apache 2.0 |
| Pydantic AI | ai.pydantic.dev | Pydantic 위에 구축된 타입 안전 에이전트 프레임워크 | MIT |
상세 비교 가이드: 로컬 AI 에이전트와 MCP
7. 음성, 스피치, 멀티모달
음성 및 멀티모달 스택은 로컬 LLM을 텍스트 너머로 확장합니다 — 음성 입력(STT), 음성 출력(TTS), 비전. Whisper.cpp와 faster-whisper는 로컬 STT 레이어를 소유합니다. Piper와 Coqui는 XTTS v2가 음성 복제를 지배하며 TTS 레이어를 공유합니다. LLaVA와 Ollama 비전 모델은 시각 측면을 담당합니다. 완전 오프라인 음성 어시스턴트는 이 레이어와 소형 채팅 모델로 구축할 수 있습니다.
| 도구 | 링크 | 설명 | 라이선스 |
|---|---|---|---|
| Whisper.cpp | github.com/ggerganov/whisper.cpp | 로컬 음성 인식, CPU 또는 GPU에서 동작 | MIT |
| faster-whisper | github.com/SYSTRAN/faster-whisper | CTranslate2를 통한 빠른 Whisper 전사 | MIT |
| Piper TTS | github.com/rhasspy/piper | 경량 로컬 텍스트 음성 변환 | MIT |
| Coqui TTS | github.com/idiap/coqui-ai-TTS | 여러 모델 옵션을 갖춘 오픈소스 음성 합성 | MPL 2.0 |
| XTTS v2 | huggingface.co/coqui/XTTS-v2 | 다국어 지원을 갖춘 음성 복제 | CPML |
| Bark | github.com/suno-ai/bark | 비음성 사운드를 포함한 생성적 음성 | MIT |
| StyleTTS 2 | github.com/yl4579/StyleTTS2 | 자연스럽게 들리는 고품질 TTS | MIT |
| LLaVA | llava-vl.github.io | 로컬 비전 + 언어 모델 | Apache 2.0 |
| Ollama 비전 모델 | ollama.com | Ollama를 통한 로컬 비전(Llama 3.2 Vision, Llava 등) | 다양 |
상세 비교 가이드: 스마트폰에서 로컬 음성 어시스턴트 구축
8. 모바일 및 엣지 클라이언트
모바일 클라이언트는 Apple Neural Engine, Qualcomm NPU 또는 순수 CPU 추론을 사용하여 양자화된 모델을 스마트폰에서 직접 실행합니다. MLC LLM 프로젝트가 기반 레이어이며, 소비자 앱(PocketPal AI, Private LLM, LLM Farm, Layla)이 채팅 인터페이스로 감쌉니다. 2026년 플래그십 폰은 실용적인 속도(8-15 토큰/초)로 2-4B 모델을 실행합니다. 7B는 최고급 하드웨어에서 가능합니다.
| 도구 | 링크 | 설명 | 라이선스 |
|---|---|---|---|
| MLC Chat | mlc.ai/mlc-llm | 크로스플랫폼 모바일 LLM 런타임 | Apache 2.0 |
| PocketPal AI | github.com/a-ghorbani/pocketpal-ai | iOS 및 Android용 무료 로컬 LLM 클라이언트 | MIT |
| Private LLM | privatellm.app | iOS 및 macOS용 세련된 로컬 LLM 앱 | 유료(비공개) |
| LLM Farm | github.com/guinmoon/LLMFarm | 모델 탐색기가 있는 iOS용 로컬 LLM | MIT |
| Layla | layla-network.ai | Android 중심 로컬 LLM 앱 | 무료(비공개) |
| Maid | github.com/Mobile-Artificial-Intelligence/maid | LLM용 오픈소스 Flutter 모바일 앱 | MIT |
| Enchanted | github.com/AugustDev/enchanted | iOS/macOS 네이티브 Ollama 클라이언트 | Apache 2.0 |
| Chapper | prevolut.uk | Ollama 및 LM Studio용 네이티브 모바일 클라이언트 | 무료 |
| RikkaHub | github.com/rikkahub/rikkahub | 오픈소스 Android 로컬 AI | MIT |
| AnythingLLM Mobile | anythingllm.com | 로컬 AnythingLLM 워크스페이스에 대한 원격 접근 | MIT |
상세 비교 가이드: 2026년 iPhone용 최고의 로컬 LLM 앱
9. 전문 및 생산성 도구
전문 도구는 로컬 LLM을 이미 사용 중인 앱에 통합합니다 — 노트 플랫폼(Obsidian, Logseq, Joplin), 자율 작업 에이전트(AutoGPT, BabyAGI, MetaGPT), 롤플레이 프런트엔드(Agnai, RisuAI). 범용 채팅 인터페이스가 아닙니다. 호스트 앱과 런타임을 이미 보유하고 있다고 가정하는 특정 워크플로 통합입니다.
| 도구 | 링크 | 설명 | 라이선스 |
|---|---|---|---|
| Smart Connections | github.com/brianpetro/obsidian-smart-connections | Obsidian용 의미론적 검색 및 채팅 플러그인 | GPL 3.0 |
| Copilot for Obsidian | github.com/logancyang/obsidian-copilot | Obsidian용 로컬 LLM 채팅 플러그인 | AGPL 3.0 |
| Text Generator | github.com/nhaouari/obsidian-textgenerator-plugin | Obsidian용 콘텐츠 생성 플러그인 | MIT |
| logseq-copilot | github.com/logancyang/logseq-copilot | Logseq용 로컬 및 클라우드 LLM 채팅 플러그인(Obsidian Copilot과 동일 작성자) | AGPL 3.0 |
| BMO Chatbot | github.com/longy2k/obsidian-bmo-chatbot | 로컬 LLM이 있는 Obsidian 챗봇 | MIT |
| Joplin AI | joplinapp.org | 로컬 AI 연동이 있는 Joplin 노트 | MIT |
| AutoGPT (로컬) | github.com/Significant-Gravitas/AutoGPT | Ollama 지원이 있는 자율 작업 에이전트 | MIT |
| BabyAGI | github.com/yoheinakajima/babyagi | 경량 자율 에이전트 | MIT |
| MetaGPT | github.com/geekan/MetaGPT | 여러 에이전트를 사용한 소프트웨어 회사 시뮬레이션 | MIT |
| Agnai | agnai.chat | 캐릭터 카드가 있는 롤플레이 프런트엔드 | MIT |
| RisuAI | github.com/kwaroran/RisuAI | 모바일 친화적 롤플레이 프런트엔드 | GPL 3.0 |
상세 비교 가이드: 2026년 Obsidian과 로컬 LLM
실제 사용 스택
9개 카테고리 전체를 읽고 싶지 않은 독자를 위해 가장 가까운 스택을 선택하고 복사하십시오. 각 행은 실제 목표를 검증된 조합 및 실제로 작동하는 최소 하드웨어와 연결합니다.
| 목표 | 스택 | 최소 하드웨어 |
|---|---|---|
| 일상적인 채팅 | LM Studio 단독 | 16 GB RAM, GPU 불필요 |
| 파워유저를 위한 최고의 균형 | Ollama + Open WebUI | 16 GB RAM, GPU 선택사항 |
| 문서 채팅 | Ollama + AnythingLLM | 16 GB RAM, GPU 선택사항 |
| 코딩 | Ollama + Continue.dev | 16 GB RAM + GPU 권장 |
| 롤플레이 / 창작 | KoboldCpp + SillyTavern | 16 GB RAM, GPU 권장 |
| 프라이버시 우선 기업 | Ollama + Open WebUI + PrivateGPT | 32 GB RAM + 12 GB VRAM |
| 모바일 / 이동 중 | MLC Chat 또는 PocketPal AI | iPhone 13+ / Pixel 7+ |
| Apple Silicon | Ollama (MLX 백엔드) 또는 LM Studio | M2/M3/M4/M5 16 GB+ 통합 메모리 |
| 멀티유저 팀 | vLLM + Open WebUI | 32 GB+ RAM + 멀티 GPU |
이 디렉토리를 최신 상태로 유지하는 방법
이 디렉토리는 6개월마다 검토되며 검토 사이에도 업데이트됩니다 — 2026년 7월 마지막 업데이트, 다음 검토는 2026년 11월 예정입니다. 가장 최근 검토에서는 모든 링크를 재확인하고 여러 프로젝트 이름 및 라이선스를 수정했습니다: Faraday는 이제 Backyard AI, 유지 관리되는 Coqui TTS 포크는 Idiap이 호스팅하며, Cherry Studio는 AGPL 3.0입니다. 포함 기준: 프로젝트가 활발히 유지 관리되고(최근 90일 내 커밋), 검증 가능한 오픈소스 라이선스 또는 명확한 상업적 사용 선언이 있으며, 2026년 기준으로 상당한 사용자 기반을 보유하거나 그렇지 않으면 비어 있을 레이어를 채웁니다. 두 릴리스 주기 이상 비활성화된 프로젝트는 제거됩니다. 기준을 충족하는 신규 프로젝트는 다음 검토 시 추가됩니다. 포함을 위한 프로젝트 제안은 PromptQuorum 저장소에 이슈 또는 PR을 열어주십시오 — 프로젝트 URL, 라이선스, 위의 형식으로 한 문장 설명을 포함하십시오.
출처
- ggml-org/llama.cpp GitHub — 런타임 아키텍처 및 지원 모델에 대한 기본 출처.
- Ollama Library — 공식 모델 카탈로그 및 런타임 문서.
- LM Studio Documentation — 주요 데스크톱 GUI의 기능 참조.
- Open WebUI Documentation — 주요 셀프호스팅 웹 인터페이스의 기능 참조.
- Hugging Face Hub — 위에 나열된 각 런타임이 사용하는 모델 가중치를 다운로드하는 기본 위치.
- awesome-local-llm GitHub list — 프로젝트 포함 확인에 사용된 커뮤니티 유지 인벤토리.
자주 묻는 질문
로컬 LLM 런타임과 데스크톱 앱의 차이는 무엇입니까?
런타임(Ollama, llama.cpp, vLLM)은 모델 가중치를 로드하고 API(보통 OpenAI 호환)를 제공하는 엔진입니다. 데스크톱 앱(LM Studio, Jan, GPT4All)은 런타임을 백그라운드에서 호출하는 채팅 인터페이스입니다. 일부 앱은 자체 런타임을 포함합니다(LM Studio는 llama.cpp를 내장). 다른 앱은 별도 런타임 설치가 필요합니다(Open WebUI는 Ollama를 호출). 런타임은 가능한 것을 결정하고, 앱은 편리한 것을 결정합니다.
이 목록에서 여러 도구를 동시에 사용할 수 있습니까?
네 — 대부분의 스택은 2-4개의 도구를 결합합니다. 일반적인 구성: Ollama를 런타임으로, Open WebUI를 채팅용으로, AnythingLLM을 문서 채팅용으로, Continue.dev를 코딩용으로 — 4개 모두 단일 머신의 동일한 Ollama 인스턴스와 함께 작동합니다. 위의 "실제 사용 스택" 표에는 충돌 없이 작동하는 레시피가 나열되어 있습니다.
텔레메트리 없이 완전 오프라인으로 작동하는 도구는 무엇입니까?
Ollama, llama.cpp, vLLM, Jan, GPT4All, Open WebUI, AnythingLLM, PrivateGPT, Continue.dev, Aider, KoboldCpp, Llamafile, MLX-LM 및 이 디렉토리의 대부분 AGPL/MIT 라이선스 앱은 모델이 다운로드되면 완전 오프라인으로 작동합니다. LM Studio와 일부 비공개 소스 도구는 설정에서 비활성화할 수 있는 선택적 분석 기능이 있습니다 — 설치 후 한 번 패킷 캡처로 확인하십시오. 웹 인터페이스(Open WebUI, LibreChat)는 로컬 백엔드를 사용하도록 구성된 경우에만 로컬입니다.
이 도구 중 일부는 상업적 라이선스(상업적 사용에 무료가 아닌)가 있습니까?
일부 있습니다: LM Studio, Msty, Backyard AI, Layla, Cursor는 비공개 소스 — 일반적으로 사용하기 무료이지만 재배포할 수 없으며 상업적 약관은 다릅니다. Private LLM은 유료입니다. AGPL 라이선스 도구(Jan, KoboldCpp, text-generation-webui, SillyTavern, Khoj, Open Interpreter, Copilot for Obsidian)는 상업적 사용을 포함한 모든 사용에 무료이지만 AGPL 약관은 수정하여 공개적으로 호스팅할 경우 소스 코드 공개를 요구합니다. Apache 2.0 및 MIT 프로젝트(대부분)는 라이선스 텍스트 이상의 귀속 제한 없이 상업적 맥락을 포함한 모든 맥락에서 사용 가능합니다.
네이티브로 Apple Silicon(M 시리즈 칩)을 지원하는 도구는 무엇입니까?
Ollama, llama.cpp, MLX-LM, LM Studio, Jan, Enchanted, GPT4All, MLC Chat, AnythingLLM 및 대부분의 Electron/Tauri 앱은 Apple Silicon에서 네이티브로 작동하며 Metal 백엔드를 사용합니다. MLX-LM은 Apple 전용이며 M 시리즈 칩의 대형 모델에 가장 빠릅니다. vLLM, TensorRT-LLM, ExLlamaV2는 NVIDIA 중심이며 Apple Silicon에서 작동하지 않거나 제대로 작동하지 않습니다 — Apple 사용자에게는 Metal 백엔드가 있는 Ollama가 기본 선택입니다.
이 도구들은 모두 GGUF 모델 형식을 지원합니까?
GGUF는 llama.cpp와 이를 감싸는 모든 도구(Ollama, LM Studio, Jan, GPT4All, KoboldCpp, Llamafile)의 네이티브 형식입니다. vLLM과 TensorRT-LLM은 더 나은 성능을 위해 자체 최적화 형식(보통 AWQ 또는 FP16)을 사용합니다. ExLlamaV2는 EXL2 양자화를 사용합니다. MLX-LM은 MLX로 변환된 가중치를 사용합니다. 나열된 대부분의 도구는 GGUF를 허용합니다. 일부(vLLM, TensorRT-LLM, ExLlamaV2, MLX-LM)는 원본 Hugging Face 가중치에서 일회성 변환 단계가 필요합니다.
코딩 경험이 없는 사용자에게 가장 좋은 도구는 무엇입니까?
GPT4All은 가장 간단한 설치(원클릭, 8 GB RAM으로 작동)를 제공합니다. LM Studio는 터미널 없이 가장 풍부한 기능을 제공합니다. Jan은 코딩 없이 가장 프라이버시 중심의 선택입니다. 명령줄 작업 없이 문서 채팅을 원한다면 AnythingLLM이 가장 쉽습니다. 네 가지 모두 위의 데스크톱 앱(GUI) 카테고리에 나열되어 있습니다.
이 도구들을 서버에서 실행하고 원격으로 접근할 수 있습니까?
서버 기능이 있는 대부분의 도구(Ollama, vLLM, LocalAI, Open WebUI, LibreChat, PrivateGPT, AnythingLLM)는 HTTP API를 노출하고 설정에서 구성 가능한 네트워크 인터페이스에 바인딩됩니다. 표준 패턴: 홈 서버나 VPS에서 Ollama를 실행하고, 서버 IP를 가리키는 랩톱이나 폰에서 인터페이스를 실행합니다. API를 다른 웹 서비스처럼 취급하십시오 — 역방향 프록시 뒤의 localhost에 바인딩하거나 적절한 인증이 있는 사설 네트워크에 바인딩합니다. Open WebUI는 멀티유저 지원을 기본으로 포함합니다.
멀티유저 / 팀 설정을 지원하는 도구는 무엇입니까?
Open WebUI, LibreChat, h2oGPT, AnythingLLM(관리자 기능 활성화 시), Dify는 역할 기반 접근 제어 및 사용자별 대화 기록이 있는 멀티유저 사용을 위해 설계되었습니다. vLLM은 동시 추론이 중요할 때 하부의 올바른 서빙 레이어입니다 — ~3 이상의 동시성에서 Ollama로는 달성할 수 없는 성능을 위해 여러 사용자의 요청을 배치 처리합니다.
이 디렉토리는 얼마나 자주 업데이트됩니까?
6개월마다 — 2026년 7월 마지막 검토, 다음 예정 업데이트는 2026년 11월입니다. 중간 변경사항(프로젝트가 비활성화, 새 도구가 상당한 점유율을 획득, 라이선스 변경)은 기존 항목에 패치로 적용됩니다. 완전히 새로운 카테고리나 레이어는 구조를 안정적으로 유지하기 위해 검토까지 기다립니다. 위의 "출처" 섹션에는 검토 사이에 생태계 동향을 모니터링하는 데 사용되는 커뮤니티 인덱스가 나열되어 있습니다.