Skip to main content
PromptQuorumPromptQuorum
/고급 로컬 LLM/로컬 LLM 소프트웨어 완전 디렉토리: 직접 소유한 하드웨어에서 AI를 실행하는 88개 도구 (2026)
Overview & Reference

로컬 LLM 소프트웨어 완전 디렉토리: 직접 소유한 하드웨어에서 AI를 실행하는 88개 도구 (2026)

·20분 분량·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

이 2026년 업데이트판 디렉토리(최종 업데이트 2026년 7월)는 88개의 로컬 LLM 도구, 배포 도구, 프레임워크를 9개 레이어에 걸쳐 정리합니다. 2026년 로컬 LLM 생태계는 명확히 이러한 레이어로 나뉩니다. 런타임(Ollama, llama.cpp, vLLM)은 모델을 통해 토큰을 처리합니다. 데스크톱 앱(LM Studio, Jan, GPT4All)은 런타임을 채팅 UI로 감쌉니다. 웹 UI(Open WebUI, LibreChat)는 브라우저에서 동일한 역할을 합니다. 코딩 어시스턴트(Continue.dev, Cline, Aider)는 로컬 모델을 편집기에 연결합니다. RAG 시스템(AnythingLLM, PrivateGPT)은 모델이 사용자의 문서를 참조하도록 합니다. 에이전트 프레임워크(LangChain, CrewAI, LangGraph)는 호출을 멀티스텝 워크플로로 연결합니다. 음성/멀티모달 스택(Whisper.cpp, Piper, LLaVA)은 텍스트 이상으로 확장합니다. 모바일 클라이언트(MLC Chat, PocketPal AI)는 스마트폰에서 동작합니다. 전문 생산성 플러그인(Obsidian, Logseq, AutoGPT)은 이미 사용 중인 도구에 통합됩니다. 먼저 런타임을 선택하고(대부분 Ollama), 그 위에 1~2개 레이어를 추가하십시오.**

이것은 88개의 로컬 LLM 도구, 앱, 프레임워크, 배포 소프트웨어를 정리한 2026년 업데이트판 디렉토리입니다 — 최종 업데이트 2026년 7월. 2026년 로컬 LLM 생태계는 처음에 잘못된 도구를 선택하면 몇 분이 아니라 몇 시간을 낭비할 만큼 방대합니다. 이 디렉토리는 현재 활발히 유지되고 있는 88개 프로젝트를 9개 레이어(런타임, 데스크톱 앱, 웹 UI, 코딩 어시스턴트, RAG 시스템, 에이전트 프레임워크, 음성/멀티모달, 모바일 클라이언트, 전문 생산성 플러그인)로 분류하여 각 도구의 설명, 라이선스, 주요 URL을 함께 제공합니다. 로컬 LLM 도구, 멀티유저 서비스를 위한 배포 도구, 에이전트 구축용 프레임워크 중 무엇을 선택하든 스택을 결정하기 전에 "무엇이 존재하는지" 파악하는 지도로 활용하십시오. 각 카테고리 마지막에는 해당 레이어에 대한 PromptQuorum의 상세 비교 가이드 링크가 있습니다.

이 페이지에는 타사 제품에 대한 참조 링크가 포함되어 있습니다. PromptQuorum은 어떤 제휴 프로그램에도 등록되어 있지 않습니다 — 이는 수수료가 발생하지 않는 일반 링크입니다. 링크 클릭 및 이후 단계는 전적으로 귀하의 책임입니다. 이 링크는 PromptQuorum의 어떠한 보증이나 검증을 나타내지 않습니다.

슬라이드 덱: 로컬 LLM 소프트웨어 완전 디렉토리: 직접 소유한 하드웨어에서 AI를 실행하는 88개 도구 (2026)

이 프레젠테이션은 다음 내용을 다룹니다: 9개 레이어(런타임부터 전문 플러그인까지)의 로컬 LLM 스택 개요, 런타임(Ollama/llama.cpp/vLLM/LocalAI/ExLlamaV2/MLX-LM), 데스크톱 앱, 웹 UI, 코딩 어시스턴트, RAG 시스템, 에이전트 프레임워크에 대한 6개 도구 비교 표, 9행으로 구성된 실제 스택 표(목표, 스택, 최소 하드웨어), 5단계 스택 선택 가이드, FAQ. 로컬 LLM 소프트웨어 디렉토리 참조 카드로 PDF를 다운로드하십시오.

아래 슬라이드를 탐색하거나 오프라인 참조용으로 PDF를 다운로드하십시오. 참조 카드 다운로드(PDF)

핵심 요점

  • 9개 레이어, 88개 프로젝트, 하나의 지도. 런타임, 데스크톱 앱, 웹 UI, 코딩 어시스턴트, RAG 시스템, 에이전트 프레임워크, 음성/멀티모달, 모바일 클라이언트, 전문 생산성 플러그인 — 2026년의 거의 모든 인기 프로젝트는 정확히 하나의 레이어에 속합니다.
  • 먼저 런타임을 선택하십시오. Ollama는 독자의 ~95%에게 적합한 기본 선택입니다. llama.cpp는 대부분의 다른 도구 뒤에 있는 기반 엔진이며, vLLM은 실제 GPU에서 멀티유저 배포 시 프로덕션 선택입니다.
  • 런타임 위의 대부분 레이어는 선택적입니다. 채팅에는 데스크톱 앱 OR 웹 UI 하나로 충분합니다. IDE 연동이 필요할 때만 코딩 어시스턴트를 추가하고, 자신의 문서와 대화할 때만 RAG 시스템을, 단일 단계 호출로 충분하지 않을 때만 에이전트 프레임워크를 추가하십시오.
  • 상업적 사용 시 라이선스가 중요합니다. MIT와 Apache 2.0이 생태계를 지배합니다. AGPL은 일부 인터페이스(text-generation-webui, KoboldCpp, Jan, SillyTavern)에 적용됩니다 — 개인 사용에는 적합하지만 상업적 배포 시에는 더 신중하게 검토해야 합니다.
  • 멀티툴 스택이 일반적입니다. Ollama + Open WebUI + AnythingLLM + Continue.dev는 채팅, RAG, 코딩을 타협 없이 커버하는 단일 머신 구성입니다. 아래의 "실제 사용 스택" 표에 2026년에 실제로 작동하는 레시피가 나열되어 있습니다.

📍 한 문장으로

2026년 로컬 LLM 생태계는 런타임, 데스크톱 앱, 웹 UI, 코딩 어시스턴트, RAG 시스템, 에이전트 프레임워크, 음성/멀티모달, 모바일 클라이언트, 전문 도구의 9개 레이어에 걸쳐 88개의 활성 프로젝트를 보유하고 있습니다.

💬 쉽게 말하면

로컬 LLM 소프트웨어는 인터넷 없이 개인 컴퓨터에서 AI를 실행하는 도구입니다. Ollama 같은 런타임이 모델을 로드하고, LM Studio 같은 앱이 채팅 화면을 제공하며, AnythingLLM 같은 도구는 사용자 문서를 참조할 수 있게 합니다.

로컬 LLM 스택의 9개 레이어: 런타임(Ollama, llama.cpp, vLLM), 데스크톱 앱(LM Studio, Jan, GPT4All), 웹 UI, 코딩 어시스턴트, RAG 시스템, 에이전트 프레임워크, 음성/멀티모달, 모바일 클라이언트, 전문 생산성 도구에 걸쳐 88개의 활성 프로젝트.
로컬 LLM 스택의 9개 레이어: 런타임(Ollama, llama.cpp, vLLM), 데스크톱 앱(LM Studio, Jan, GPT4All), 웹 UI, 코딩 어시스턴트, RAG 시스템, 에이전트 프레임워크, 음성/멀티모달, 모바일 클라이언트, 전문 생산성 도구에 걸쳐 88개의 활성 프로젝트.

1. 로컬 LLM 런타임 및 추론 엔진

런타임은 모델 가중치를 메모리에 로드하고 프롬프트를 토큰으로 변환하는 엔진입니다. 로컬 LLM 스택에서 첫 번째 결정이며 그 위의 모든 것을 결정합니다 — 데스크톱 앱, 웹 UI, 코딩 어시스턴트는 모두 결국 런타임을 호출합니다. Ollama는 2026년 사용자 지향 시장 점유율을 지배합니다. OpenAI 호환 API와 단일 명령 설치를 제공하기 때문입니다. llama.cpp는 대부분의 다른 도구 기반에 있는 C++ 엔진이며, vLLM은 실제 GPU에서 동시 사용자를 서비스해야 할 때 적합한 선택입니다.

도구링크설명라이선스
Ollamaollama.com전반적으로 가장 쉬운 — 단일 명령 설치, OpenAI 호환 API, 대형 모델 라이브러리MIT
llama.cppgithub.com/ggml-org/llama.cpp대부분의 다른 도구 기반에 있는 C++ 엔진, Apple Silicon 포함 어디서나 동작MIT
vLLMgithub.com/vllm-project/vllm멀티유저 GPU 배포를 위한 고성능 서빙Apache 2.0
LocalAIlocalai.io여러 백엔드를 지원하는 OpenAI API 드롭인 대체MIT
TensorRT-LLMgithub.com/NVIDIA/TensorRT-LLM엔터프라이즈 GPU 구성을 위한 NVIDIA 최적화 추론Apache 2.0
MLC LLMmlc.ai/mlc-llm모바일 및 엣지 디바이스용 배포 런타임Apache 2.0
SGLanggithub.com/sgl-project/sglang에이전트 파이프라인을 위한 구조화 추론 서빙Apache 2.0
ExLlamaV2github.com/turboderp-org/exllamav2RTX GPU에 최적화된 빠른 양자화 추론MIT
KoboldCppgithub.com/LostRuins/koboldcpp내장 인터페이스가 포함된 llama.cpp 경량 래퍼AGPL 3.0
Llamafilegithub.com/Mozilla-Ocho/llamafileMozilla의 단일 파일 포터블 LLM 실행Apache 2.0
MLX-LMgithub.com/ml-explore/mlx-examplesApple Research의 Apple Silicon 네이티브 런타임MIT

상세 비교 가이드: llama.cpp vs Ollama vs vLLM

Ollama vs llama.cpp vs vLLM: Ollama는 단일 명령 설치와 OpenAI 호환 API를 갖춘 MIT 라이선스, llama.cpp는 MIT 라이선스의 기반 C++ 엔진, vLLM은 GPU 배포를 위한 Apache 2.0 멀티유저 서빙 옵션.
Ollama vs llama.cpp vs vLLM: Ollama는 단일 명령 설치와 OpenAI 호환 API를 갖춘 MIT 라이선스, llama.cpp는 MIT 라이선스의 기반 C++ 엔진, vLLM은 GPU 배포를 위한 Apache 2.0 멀티유저 서빙 옵션.
RunPod 가격 확인 및 회원가입제품 링크 · 공개됨Vast.ai 가격 확인 및 회원가입제품 링크 · 공개됨Lambda Labs 가격 확인 및 회원가입제품 링크 · 공개됨

2. 데스크톱 앱 (GUI)

데스크톱 앱은 런타임을 채팅 인터페이스와 모델 탐색기로 감쌉니다. 터미널 단계가 없기 때문에 대부분의 비기술적 사용자가 시작하는 곳입니다 — 다운로드, 클릭, 채팅. LM Studio, Jan, GPT4All이 2026년 사용자 기반의 대부분을 차지합니다. AnythingLLM은 데스크톱 앱이자 RAG 레이어로도 기능하며, Open Interpreter는 로컬 모델이 컴퓨터를 제어하도록 허용하는 특수한 경우입니다.

도구링크설명라이선스
LM Studiolmstudio.ai가장 세련된 GUI, HuggingFace 모델 탐색기 내장, 서버 모드무료(비공개)
Atomic Chatatomic.chat데스크톱과 모바일용 오프라인 채팅 앱, 원클릭으로 로컬 에이전트 실행Apache 2.0
Janjan.ai프라이버시 중심의 오프라인 ChatGPT 클론, 완전 오픈소스AGPL 3.0
GPT4Allnomic.ai/gpt4all강력한 CPU 전용 지원을 갖춘 입문자 친화적 앱MIT
AnythingLLManythingllm.com내장 벡터 저장소를 갖춘 RAG 및 문서 채팅MIT
Mstymsty.app깔끔한 소비자 UX, 멀티 제공자 지원무료(비공개)
Cherry Studiocherry-ai.com광범위한 커스터마이징을 갖춘 멀티 제공자 데스크톱 AIAGPL 3.0
Backyard AIbackyard.ai캐릭터 채팅 및 롤플레이용 데스크톱 클라이언트무료(비공개)
Enchantedgithub.com/AugustDev/enchanted최소한의 macOS/iOS 네이티브 Ollama 클라이언트Apache 2.0
h2oGPTgithub.com/h2oai/h2ogpt많은 엔터프라이즈 기능을 갖춘 데스크톱 및 서버Apache 2.0
Open Interpretergithub.com/OpenInterpreter/open-interpreter로컬 LLM이 컴퓨터를 제어하고 코드를 실행하도록 허용AGPL 3.0

상세 비교 가이드: LM Studio vs Jan vs GPT4All

Msty 가격 확인제품 링크 · 공개됨AnythingLLM Cloud 가격 확인제품 링크 · 공개됨

3. 웹 UI 및 브라우저 프런트엔드

웹 UI는 셀프호스팅 ChatGPT 클론입니다 — 동일한 대화 인터페이스지만, 직접 소유한 머신이나 LAN에서 실행되는 런타임을 가리킵니다. 랩톱, 폰, 태블릿이 서버를 가리키는 멀티디바이스 접근이나 팀 사용에 자연스러운 선택입니다. Open WebUI는 2026년 셀프호스팅 세그먼트를 지배하며, LibreChat은 팀 기능 대안, SillyTavern은 전용 롤플레이 인터페이스입니다.

도구링크설명라이선스
Open WebUIopenwebui.com가장 인기 있는 ChatGPT 스타일 셀프호스팅 인터페이스, RAG 내장BSD 3-Clause
LibreChatlibrechat.ai팀 기능을 갖춘 멀티모델 ChatGPT 대안MIT
text-generation-webuigithub.com/oobabooga/text-generation-webui방대한 플러그인 생태계를 갖춘 파워유저용 인터페이스AGPL 3.0
SillyTaverngithub.com/SillyTavern/SillyTavern로어북이 있는 롤플레이 및 캐릭터 채팅AGPL 3.0
LobeChatlobehub.com플러그인 마켓플레이스가 있는 현대적이고 세련된 인터페이스MIT
Big-AGIgithub.com/enricoros/big-AGI페르소나가 있는 고급 멀티 제공자 프런트엔드MIT
NextChatgithub.com/ChatGPTNextWeb/NextChat간단한 배포가 가능한 경량 웹 채팅MIT
Page Assistgithub.com/n4ze3m/page-assistChrome 및 Firefox용 브라우저 사이드바 AIMIT
Chatboxchatboxai.app크로스플랫폼 데스크톱 및 웹 클라이언트GPLv3

상세 비교 가이드: SillyTavern vs Agnai vs RisuAI

4. 코딩 어시스턴트 및 IDE 연동

코딩 어시스턴트는 OpenAI 호환 API를 통해 로컬 LLM을 편집기나 터미널에 연결합니다. 선택은 주로 워크플로에 따라 달라집니다: 편집기 내 자동 완성(Continue.dev), 자율 에이전트 편집(Cline, OpenHands), 또는 터미널에서 git 네이티브 diff 편집(Aider). 세 패턴 모두 OpenAI Chat Completions 프로토콜을 지원하는 런타임에서 작동합니다 — 2026년에는 Ollama가 가장 일반적인 백엔드입니다.

도구링크설명라이선스
Continue.devcontinue.dev로컬 모델로 VS Code 및 JetBrains에서 자동 완성 및 채팅Apache 2.0
Aideraider.chat멀티파일 편집 지원을 갖춘 터미널 페어 프로그래머Apache 2.0
Clinecline.botVS Code용 자율 코드 에이전트Apache 2.0
Tabbytabby.tabbyml.comGitHub Copilot의 셀프호스팅 대안Apache 2.0
CodeGPTcodegpt.co여러 편집기를 위한 IDE 연동MIT
OpenHandsgithub.com/All-Hands-AI/OpenHandsAI 소프트웨어 개발 에이전트 (이전 이름: OpenDevin)MIT
Cursor (로컬 모드)cursor.com로컬 모델 지원을 갖춘 AI 중심 코드 편집기무료(비공개)
Twinnygithub.com/twinnydotdev/twinnyVS Code용 무료 Copilot 대안MIT

상세 비교 가이드: Continue.dev vs Cline vs Aider

로컬 LLM을 사용한 3가지 코딩 패턴: VS Code 및 JetBrains에서 인라인 자동 완성을 위한 Continue.dev, 자율 에이전트 편집을 위한 Cline, git 네이티브 터미널 diff를 위한 Aider — 모두 OpenAI 호환 API를 통해 Ollama에 연결됩니다.
로컬 LLM을 사용한 3가지 코딩 패턴: VS Code 및 JetBrains에서 인라인 자동 완성을 위한 Continue.dev, 자율 에이전트 편집을 위한 Cline, git 네이티브 터미널 diff를 위한 Aider — 모두 OpenAI 호환 API를 통해 Ollama에 연결됩니다.
Cursor 가격 확인제품 링크 · 공개됨

5. RAG 시스템 및 문서 채팅

RAG (Retrieval-Augmented Generation) 시스템은 로컬 LLM을 임베딩 모델 및 벡터 저장소와 결합하여 모델이 사용자 자신의 문서에서 답변할 수 있게 합니다.** "그냥 작동하는" 턴키 앱(AnythingLLM, PrivateGPT, Quivr, Khoj)과 구축의 기반이 되는 프레임워크 라이브러리(LlamaIndex, Haystack, txtai)로 나뉩니다. RAGFlow는 특히 고품질 인용 추출이 필요한 문서에 대해 2026년에 점유율을 늘리고 있습니다.

도구링크설명라이선스
AnythingLLManythingllm.com워크스페이스가 있는 가장 쉬운 올인원 개인 RAGMIT
PrivateGPTgithub.com/zylon-ai/private-gpt기업 지향의 완전 오프라인 RAGApache 2.0
Quivrgithub.com/QuivrHQ/quivr셀프호스팅 개인 지식 어시스턴트Apache 2.0
Khojkhoj.devObsidian 및 Notion과 동기화되는 개인 AI 제2의 뇌AGPL 3.0
Difydify.aiRAG 및 에이전트 지원을 갖춘 AI 워크플로 빌더Modified Apache 2.0
Flowiseflowiseai.com시각적 LangChain 워크플로 빌더Apache 2.0
Langflowlangflow.orgRAG 컴포넌트를 갖춘 시각적 AI 오케스트레이션MIT
LlamaIndexllamaindex.aiRAG 프레임워크 / Python 라이브러리 — 맞춤형 개발의 기반MIT
Haystackhaystack.deepset.aideepset의 검색 및 RAG 프레임워크Apache 2.0
RAGFlowragflow.io인용 추출 기능이 있는 문서 심층 이해 RAGApache 2.0
txtaigithub.com/neuml/txtai단일 라이브러리에 통합된 벡터 데이터베이스 + LLMApache 2.0

상세 비교 가이드: AnythingLLM vs PrivateGPT vs Open WebUI

로컬 RAG 분류: 코드 없이 문서 채팅을 위한 턴키 앱(AnythingLLM, PrivateGPT, Quivr, RAGFlow, Khoj) vs 맞춤형 파이프라인 구축을 위한 프레임워크 라이브러리(LlamaIndex, Haystack, Dify, Flowise, txtai).
로컬 RAG 분류: 코드 없이 문서 채팅을 위한 턴키 앱(AnythingLLM, PrivateGPT, Quivr, RAGFlow, Khoj) vs 맞춤형 파이프라인 구축을 위한 프레임워크 라이브러리(LlamaIndex, Haystack, Dify, Flowise, txtai).

6. 에이전트 프레임워크 및 오케스트레이션

에이전트 프레임워크는 LLM에 대한 단일 단계 호출을 멀티스텝 워크플로(계획, 행동, 관찰, 반복)로 전환합니다. LangChain은 여전히 범용 표준입니다. CrewAI와 AutoGen은 역할 기반 멀티에이전트 설정에 특화되어 있습니다. LangGraph는 장기 실행 흐름에서 상태 관리가 중요할 때 올바른 선택입니다. 아래 8개 프레임워크 모두 Ollama 로컬 백엔드와 원활하게 작동합니다.

도구링크설명라이선스
LangChainlangchain.com범용 LLM 애플리케이션 프레임워크MIT
LlamaIndexllamaindex.aiRAG 중심의 에이전트 및 데이터 프레임워크MIT
CrewAIcrewai.com역할 기반 멀티에이전트 워크플로MIT
AutoGengithub.com/microsoft/autogenMicrosoft의 멀티에이전트 오케스트레이션 프레임워크CC-BY-4.0 / MIT
Semantic Kernellearn.microsoft.com/semantic-kernelC#/Python/Java용 Microsoft 엔터프라이즈 오케스트레이션 SDKMIT
LangGraphlangchain-ai.github.io/langgraph상태를 갖춘 그래프 기반 에이전트 워크플로MIT
Letta (이전 이름: MemGPT)letta.com장기 기억을 갖춘 에이전트Apache 2.0
Pydantic AIai.pydantic.devPydantic 위에 구축된 타입 안전 에이전트 프레임워크MIT

상세 비교 가이드: 로컬 AI 에이전트와 MCP

7. 음성, 스피치, 멀티모달

음성 및 멀티모달 스택은 로컬 LLM을 텍스트 너머로 확장합니다 — 음성 입력(STT), 음성 출력(TTS), 비전. Whisper.cpp와 faster-whisper는 로컬 STT 레이어를 소유합니다. Piper와 Coqui는 XTTS v2가 음성 복제를 지배하며 TTS 레이어를 공유합니다. LLaVA와 Ollama 비전 모델은 시각 측면을 담당합니다. 완전 오프라인 음성 어시스턴트는 이 레이어와 소형 채팅 모델로 구축할 수 있습니다.

도구링크설명라이선스
Whisper.cppgithub.com/ggerganov/whisper.cpp로컬 음성 인식, CPU 또는 GPU에서 동작MIT
faster-whispergithub.com/SYSTRAN/faster-whisperCTranslate2를 통한 빠른 Whisper 전사MIT
Piper TTSgithub.com/rhasspy/piper경량 로컬 텍스트 음성 변환MIT
Coqui TTSgithub.com/idiap/coqui-ai-TTS여러 모델 옵션을 갖춘 오픈소스 음성 합성MPL 2.0
XTTS v2huggingface.co/coqui/XTTS-v2다국어 지원을 갖춘 음성 복제CPML
Barkgithub.com/suno-ai/bark비음성 사운드를 포함한 생성적 음성MIT
StyleTTS 2github.com/yl4579/StyleTTS2자연스럽게 들리는 고품질 TTSMIT
LLaVAllava-vl.github.io로컬 비전 + 언어 모델Apache 2.0
Ollama 비전 모델ollama.comOllama를 통한 로컬 비전(Llama 3.2 Vision, Llava 등)다양

상세 비교 가이드: 스마트폰에서 로컬 음성 어시스턴트 구축

8. 모바일 및 엣지 클라이언트

모바일 클라이언트는 Apple Neural Engine, Qualcomm NPU 또는 순수 CPU 추론을 사용하여 양자화된 모델을 스마트폰에서 직접 실행합니다. MLC LLM 프로젝트가 기반 레이어이며, 소비자 앱(PocketPal AI, Private LLM, LLM Farm, Layla)이 채팅 인터페이스로 감쌉니다. 2026년 플래그십 폰은 실용적인 속도(8-15 토큰/초)로 2-4B 모델을 실행합니다. 7B는 최고급 하드웨어에서 가능합니다.

도구링크설명라이선스
MLC Chatmlc.ai/mlc-llm크로스플랫폼 모바일 LLM 런타임Apache 2.0
PocketPal AIgithub.com/a-ghorbani/pocketpal-aiiOS 및 Android용 무료 로컬 LLM 클라이언트MIT
Private LLMprivatellm.appiOS 및 macOS용 세련된 로컬 LLM 앱유료(비공개)
LLM Farmgithub.com/guinmoon/LLMFarm모델 탐색기가 있는 iOS용 로컬 LLMMIT
Laylalayla-network.aiAndroid 중심 로컬 LLM 앱무료(비공개)
Maidgithub.com/Mobile-Artificial-Intelligence/maidLLM용 오픈소스 Flutter 모바일 앱MIT
Enchantedgithub.com/AugustDev/enchantediOS/macOS 네이티브 Ollama 클라이언트Apache 2.0
Chapperprevolut.ukOllama 및 LM Studio용 네이티브 모바일 클라이언트무료
RikkaHubgithub.com/rikkahub/rikkahub오픈소스 Android 로컬 AIMIT
AnythingLLM Mobileanythingllm.com로컬 AnythingLLM 워크스페이스에 대한 원격 접근MIT

상세 비교 가이드: 2026년 iPhone용 최고의 로컬 LLM 앱

9. 전문 및 생산성 도구

전문 도구는 로컬 LLM을 이미 사용 중인 앱에 통합합니다 — 노트 플랫폼(Obsidian, Logseq, Joplin), 자율 작업 에이전트(AutoGPT, BabyAGI, MetaGPT), 롤플레이 프런트엔드(Agnai, RisuAI). 범용 채팅 인터페이스가 아닙니다. 호스트 앱과 런타임을 이미 보유하고 있다고 가정하는 특정 워크플로 통합입니다.

도구링크설명라이선스
Smart Connectionsgithub.com/brianpetro/obsidian-smart-connectionsObsidian용 의미론적 검색 및 채팅 플러그인GPL 3.0
Copilot for Obsidiangithub.com/logancyang/obsidian-copilotObsidian용 로컬 LLM 채팅 플러그인AGPL 3.0
Text Generatorgithub.com/nhaouari/obsidian-textgenerator-pluginObsidian용 콘텐츠 생성 플러그인MIT
logseq-copilotgithub.com/logancyang/logseq-copilotLogseq용 로컬 및 클라우드 LLM 채팅 플러그인(Obsidian Copilot과 동일 작성자)AGPL 3.0
BMO Chatbotgithub.com/longy2k/obsidian-bmo-chatbot로컬 LLM이 있는 Obsidian 챗봇MIT
Joplin AIjoplinapp.org로컬 AI 연동이 있는 Joplin 노트MIT
AutoGPT (로컬)github.com/Significant-Gravitas/AutoGPTOllama 지원이 있는 자율 작업 에이전트MIT
BabyAGIgithub.com/yoheinakajima/babyagi경량 자율 에이전트MIT
MetaGPTgithub.com/geekan/MetaGPT여러 에이전트를 사용한 소프트웨어 회사 시뮬레이션MIT
Agnaiagnai.chat캐릭터 카드가 있는 롤플레이 프런트엔드MIT
RisuAIgithub.com/kwaroran/RisuAI모바일 친화적 롤플레이 프런트엔드GPL 3.0

상세 비교 가이드: 2026년 Obsidian과 로컬 LLM

실제 사용 스택

9개 카테고리 전체를 읽고 싶지 않은 독자를 위해 가장 가까운 스택을 선택하고 복사하십시오. 각 행은 실제 목표를 검증된 조합 및 실제로 작동하는 최소 하드웨어와 연결합니다.

목표스택최소 하드웨어
일상적인 채팅LM Studio 단독16 GB RAM, GPU 불필요
파워유저를 위한 최고의 균형Ollama + Open WebUI16 GB RAM, GPU 선택사항
문서 채팅Ollama + AnythingLLM16 GB RAM, GPU 선택사항
코딩Ollama + Continue.dev16 GB RAM + GPU 권장
롤플레이 / 창작KoboldCpp + SillyTavern16 GB RAM, GPU 권장
프라이버시 우선 기업Ollama + Open WebUI + PrivateGPT32 GB RAM + 12 GB VRAM
모바일 / 이동 중MLC Chat 또는 PocketPal AIiPhone 13+ / Pixel 7+
Apple SiliconOllama (MLX 백엔드) 또는 LM StudioM2/M3/M4/M5 16 GB+ 통합 메모리
멀티유저 팀vLLM + Open WebUI32 GB+ RAM + 멀티 GPU
목표별 일반적인 로컬 LLM 스택 9가지: LM Studio 단독(16 GB RAM, GPU 불필요)부터 멀티유저 팀을 위한 vLLM + Open WebUI(32 GB RAM + 멀티 GPU)까지, 기본 균형 옵션은 16 GB RAM의 Ollama + Open WebUI.
목표별 일반적인 로컬 LLM 스택 9가지: LM Studio 단독(16 GB RAM, GPU 불필요)부터 멀티유저 팀을 위한 vLLM + Open WebUI(32 GB RAM + 멀티 GPU)까지, 기본 균형 옵션은 16 GB RAM의 Ollama + Open WebUI.

이 디렉토리를 최신 상태로 유지하는 방법

이 디렉토리는 6개월마다 검토되며 검토 사이에도 업데이트됩니다 — 2026년 7월 마지막 업데이트, 다음 검토는 2026년 11월 예정입니다. 가장 최근 검토에서는 모든 링크를 재확인하고 여러 프로젝트 이름 및 라이선스를 수정했습니다: Faraday는 이제 Backyard AI, 유지 관리되는 Coqui TTS 포크는 Idiap이 호스팅하며, Cherry Studio는 AGPL 3.0입니다. 포함 기준: 프로젝트가 활발히 유지 관리되고(최근 90일 내 커밋), 검증 가능한 오픈소스 라이선스 또는 명확한 상업적 사용 선언이 있으며, 2026년 기준으로 상당한 사용자 기반을 보유하거나 그렇지 않으면 비어 있을 레이어를 채웁니다. 두 릴리스 주기 이상 비활성화된 프로젝트는 제거됩니다. 기준을 충족하는 신규 프로젝트는 다음 검토 시 추가됩니다. 포함을 위한 프로젝트 제안은 PromptQuorum 저장소에 이슈 또는 PR을 열어주십시오 — 프로젝트 URL, 라이선스, 위의 형식으로 한 문장 설명을 포함하십시오.

출처

자주 묻는 질문

로컬 LLM 런타임과 데스크톱 앱의 차이는 무엇입니까?

런타임(Ollama, llama.cpp, vLLM)은 모델 가중치를 로드하고 API(보통 OpenAI 호환)를 제공하는 엔진입니다. 데스크톱 앱(LM Studio, Jan, GPT4All)은 런타임을 백그라운드에서 호출하는 채팅 인터페이스입니다. 일부 앱은 자체 런타임을 포함합니다(LM Studio는 llama.cpp를 내장). 다른 앱은 별도 런타임 설치가 필요합니다(Open WebUI는 Ollama를 호출). 런타임은 가능한 것을 결정하고, 앱은 편리한 것을 결정합니다.

이 목록에서 여러 도구를 동시에 사용할 수 있습니까?

네 — 대부분의 스택은 2-4개의 도구를 결합합니다. 일반적인 구성: Ollama를 런타임으로, Open WebUI를 채팅용으로, AnythingLLM을 문서 채팅용으로, Continue.dev를 코딩용으로 — 4개 모두 단일 머신의 동일한 Ollama 인스턴스와 함께 작동합니다. 위의 "실제 사용 스택" 표에는 충돌 없이 작동하는 레시피가 나열되어 있습니다.

텔레메트리 없이 완전 오프라인으로 작동하는 도구는 무엇입니까?

Ollama, llama.cpp, vLLM, Jan, GPT4All, Open WebUI, AnythingLLM, PrivateGPT, Continue.dev, Aider, KoboldCpp, Llamafile, MLX-LM 및 이 디렉토리의 대부분 AGPL/MIT 라이선스 앱은 모델이 다운로드되면 완전 오프라인으로 작동합니다. LM Studio와 일부 비공개 소스 도구는 설정에서 비활성화할 수 있는 선택적 분석 기능이 있습니다 — 설치 후 한 번 패킷 캡처로 확인하십시오. 웹 인터페이스(Open WebUI, LibreChat)는 로컬 백엔드를 사용하도록 구성된 경우에만 로컬입니다.

이 도구 중 일부는 상업적 라이선스(상업적 사용에 무료가 아닌)가 있습니까?

일부 있습니다: LM Studio, Msty, Backyard AI, Layla, Cursor는 비공개 소스 — 일반적으로 사용하기 무료이지만 재배포할 수 없으며 상업적 약관은 다릅니다. Private LLM은 유료입니다. AGPL 라이선스 도구(Jan, KoboldCpp, text-generation-webui, SillyTavern, Khoj, Open Interpreter, Copilot for Obsidian)는 상업적 사용을 포함한 모든 사용에 무료이지만 AGPL 약관은 수정하여 공개적으로 호스팅할 경우 소스 코드 공개를 요구합니다. Apache 2.0 및 MIT 프로젝트(대부분)는 라이선스 텍스트 이상의 귀속 제한 없이 상업적 맥락을 포함한 모든 맥락에서 사용 가능합니다.

네이티브로 Apple Silicon(M 시리즈 칩)을 지원하는 도구는 무엇입니까?

Ollama, llama.cpp, MLX-LM, LM Studio, Jan, Enchanted, GPT4All, MLC Chat, AnythingLLM 및 대부분의 Electron/Tauri 앱은 Apple Silicon에서 네이티브로 작동하며 Metal 백엔드를 사용합니다. MLX-LM은 Apple 전용이며 M 시리즈 칩의 대형 모델에 가장 빠릅니다. vLLM, TensorRT-LLM, ExLlamaV2는 NVIDIA 중심이며 Apple Silicon에서 작동하지 않거나 제대로 작동하지 않습니다 — Apple 사용자에게는 Metal 백엔드가 있는 Ollama가 기본 선택입니다.

이 도구들은 모두 GGUF 모델 형식을 지원합니까?

GGUF는 llama.cpp와 이를 감싸는 모든 도구(Ollama, LM Studio, Jan, GPT4All, KoboldCpp, Llamafile)의 네이티브 형식입니다. vLLM과 TensorRT-LLM은 더 나은 성능을 위해 자체 최적화 형식(보통 AWQ 또는 FP16)을 사용합니다. ExLlamaV2는 EXL2 양자화를 사용합니다. MLX-LM은 MLX로 변환된 가중치를 사용합니다. 나열된 대부분의 도구는 GGUF를 허용합니다. 일부(vLLM, TensorRT-LLM, ExLlamaV2, MLX-LM)는 원본 Hugging Face 가중치에서 일회성 변환 단계가 필요합니다.

코딩 경험이 없는 사용자에게 가장 좋은 도구는 무엇입니까?

GPT4All은 가장 간단한 설치(원클릭, 8 GB RAM으로 작동)를 제공합니다. LM Studio는 터미널 없이 가장 풍부한 기능을 제공합니다. Jan은 코딩 없이 가장 프라이버시 중심의 선택입니다. 명령줄 작업 없이 문서 채팅을 원한다면 AnythingLLM이 가장 쉽습니다. 네 가지 모두 위의 데스크톱 앱(GUI) 카테고리에 나열되어 있습니다.

이 도구들을 서버에서 실행하고 원격으로 접근할 수 있습니까?

서버 기능이 있는 대부분의 도구(Ollama, vLLM, LocalAI, Open WebUI, LibreChat, PrivateGPT, AnythingLLM)는 HTTP API를 노출하고 설정에서 구성 가능한 네트워크 인터페이스에 바인딩됩니다. 표준 패턴: 홈 서버나 VPS에서 Ollama를 실행하고, 서버 IP를 가리키는 랩톱이나 폰에서 인터페이스를 실행합니다. API를 다른 웹 서비스처럼 취급하십시오 — 역방향 프록시 뒤의 localhost에 바인딩하거나 적절한 인증이 있는 사설 네트워크에 바인딩합니다. Open WebUI는 멀티유저 지원을 기본으로 포함합니다.

멀티유저 / 팀 설정을 지원하는 도구는 무엇입니까?

Open WebUI, LibreChat, h2oGPT, AnythingLLM(관리자 기능 활성화 시), Dify는 역할 기반 접근 제어 및 사용자별 대화 기록이 있는 멀티유저 사용을 위해 설계되었습니다. vLLM은 동시 추론이 중요할 때 하부의 올바른 서빙 레이어입니다 — ~3 이상의 동시성에서 Ollama로는 달성할 수 없는 성능을 위해 여러 사용자의 요청을 배치 처리합니다.

이 디렉토리는 얼마나 자주 업데이트됩니까?

6개월마다 — 2026년 7월 마지막 검토, 다음 예정 업데이트는 2026년 11월입니다. 중간 변경사항(프로젝트가 비활성화, 새 도구가 상당한 점유율을 획득, 라이선스 변경)은 기존 항목에 패치로 적용됩니다. 완전히 새로운 카테고리나 레이어는 구조를 안정적으로 유지하기 위해 검토까지 기다립니다. 위의 "출처" 섹션에는 검토 사이에 생태계 동향을 모니터링하는 데 사용되는 커뮤니티 인덱스가 나열되어 있습니다.

← 고급 로컬 LLM으로 돌아가기