핵심 요점
- 도구 46개, 세 종류: 추론 엔진(30개), 런타임과 매니저(13개), 라우터와 게이트웨이(4개). Ollama는 엔진이자 런타임이므로 두 그룹에 모두 나타납니다.
- 표는 각 도구의 레코드로 생성되고 공식 README 또는 사이트와 대조해 확인했습니다. 대시는 "문서에 명시되지 않음"을 뜻하며 "아니오"를 뜻하지 않습니다. 잘 알려진 일부 도구는 여기서 인용한 문서에 특정 기능에 대한 언급이 없어 해당 셀이 대시로 표시됩니다.
- 표의 모든 도구 이름은 해당 도구의 PromptQuorum 리뷰로 연결되며, 설치 단계와 한계는 그 리뷰에서 다룹니다.
📍 한 문장으로
모델을 로컬에서 실행하려면 추론 엔진, 런타임과 매니저, 라우터와 게이트웨이라는 세 종류의 도구가 필요하므로, PromptQuorum 디렉터리의 도구 46개를 종류별로 나누어 비교하며, 비교표는 각 도구의 리뷰와 동일한 도구 데이터로 생성됩니다.
💬 쉽게 말하면
엔진은 모델을 실제로 구동하는 부분이고, 런타임이나 매니저는 모델을 대신 내려받아 실행해 주며, 게이트웨이는 그 사이에서 요청을 전달합니다. 엔진과 게이트웨이를 GPU 지원 여부로 비교하는 것은 의미가 없으므로, 이 가이드는 같은 종류끼리 비교합니다.
비교 방법
각 도구의 사실 정보, 즉 가격, 라이선스, 플랫폼, 하드웨어 요건, 카테고리별 속성은 해당 도구의 디렉터리 레코드에 한 번만 저장됩니다. 아래 비교표는 이 레코드로 생성되고 도구별 리뷰도 같은 레코드를 바탕으로 작성되므로, 두 곳이 서로 다른 값을 표기할 수 없습니다.
카테고리별 속성(예: OpenAI 호환 API 또는 AMD GPU 지원)은 각 프로젝트의 공식 README 또는 웹사이트에서 가져와 그곳의 정확한 표현과 대조해 확인했습니다. 문서에 언급이 없는 경우 표에는 추측하지 않고 대시를 표시합니다. 주장에 단서가 붙는 경우(실험적, 계획 중, 또는 별도 프로젝트를 통해서만 제공)에는 해당 속성을 표에서 제외하고 그 도구의 리뷰에서 다룹니다.
자체 PromptQuorum 리뷰가 있는 도구만 표에 포함됩니다. API 서버로만 등록된 도구(h2oGPT, Tabby, OpenAI Edge TTS)는 각자의 카테고리에서 비교합니다. 이 비교는 자신의 하드웨어에서 실행되는 도구를 나열할 뿐 순위를 매기지 않습니다. 적합한 도구는 각자의 조건에 따라 달라지기 때문입니다.
비교표
아래에서 도구 종류를 선택한 다음 행을 따라 읽으세요. 도구 이름을 클릭하면 해당 PromptQuorum 리뷰 전문이 열립니다.
| 도구 | 가격 | 라이선스 | 플랫폼 | 실행 방식 | 하드웨어 | 버전 | OpenAI 호환 API | NVIDIA GPU | Apple Silicon | AMD GPU | CPU 추론 | 멀티 GPU / 멀티 노드 | 리뷰 | 제품 링크 · 공개됨 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| candle-vllm | 무료 | MIT | macOS, Windows, Linux | 로컬 | 모델에 따라 다름 | v0.9.1 | 예 | 예 | 예 | — | — | 예 | 리뷰 읽기 → | candle-vllm |
| claude-code-local | 무료 | MIT | macOS | 로컬 | 모델에 따라 다름 | v0.3.0 | — | — | 예 | — | — | — | 리뷰 읽기 → | claude-code-local |
| ExLlamaV2 | 무료 | MIT | Windows, Linux | 로컬 | VRAM 8 GB | v0.3.2 | — | 예 | — | — | — | 예 | 리뷰 읽기 → | ExLlamaV2 |
| exo | 무료 | Apache-2.0 | macOS, Linux | 로컬 | 모델에 따라 다름 | — | 예 | — | 예 | — | 예 | 예 | 리뷰 읽기 → | exo |
| KoboldCpp | 무료 | AGPL-3.0 | Windows, Linux, macOS | 로컬 | 모델에 따라 다름 | v1.121 | 예 | 예 | 예 | 예 | 예 | — | 리뷰 읽기 → | KoboldCpp |
| KServe | 무료 | Apache-2.0 | Linux | 로컬 | CPU만으로 충분 | v0.20.0 | 예 | — | — | — | — | 예 | 리뷰 읽기 → | KServe |
| llama.cpp | 무료 | MIT | macOS, Windows, Linux | 로컬 | 모델에 따라 다름 | v0.4.1 | 예 | 예 | 예 | 예 | 예 | — | 리뷰 읽기 → | llama.cpp |
| Llamafile | 무료 | Apache-2.0 | macOS, Windows, Linux | 로컬 | 모델에 따라 다름 | 0.10.6 | — | — | — | — | — | — | 리뷰 읽기 → | Llamafile |
| LMDeploy | 무료 | Apache-2.0 | Linux | 로컬 | 모델에 따라 다름 | v0.17.0 | — | 예 | — | — | — | 예 | 리뷰 읽기 → | LMDeploy |
| LocalAI | 무료 | MIT | macOS, Windows, Linux | 로컬 | 모델에 따라 다름 | — | 예 | 예 | 예 | 예 | 예 | 예 | 리뷰 읽기 → | LocalAI |
| LoRAX | 무료 | Apache-2.0 | Linux | 로컬 | 모델에 따라 다름 | v0.12.1 | 예 | 예 | — | — | — | 예 | 리뷰 읽기 → | LoRAX |
| Lucebox | 무료 | Apache-2.0 | Linux | 로컬 | 모델에 따라 다름 | — | 예 | 예 | — | 예 | — | 예 | 리뷰 읽기 → | Lucebox |
| MLC LLM | 무료 | Apache-2.0 | macOS, Windows, Linux, iOS, Android | 로컬 | 모델에 따라 다름 | — | 예 | 예 | 예 | 예 | — | — | 리뷰 읽기 → | MLC LLM |
| MLX-LM | 무료 | MIT | macOS | 로컬 | 모델에 따라 다름 | — | — | — | 예 | — | — | 예 | 리뷰 읽기 → | MLX-LM |
| mlx-serve | 무료 | MIT | macOS | 로컬 | 모델에 따라 다름 | v26.9.4 | 예 | — | 예 | — | — | — | 리뷰 읽기 → | mlx-serve |
| mlxcel | 무료 | Apache-2.0 | macOS, Linux | 로컬 | 모델에 따라 다름 | v0.7.0 | 예 | 예 | 예 | — | — | 예 | 리뷰 읽기 → | mlxcel |
| NVIDIA Dynamo | 무료 | Apache-2.0 | Linux | 로컬 | 모델에 따라 다름 | v1.4–v1.6 | 예 | — | — | — | — | 예 | 리뷰 읽기 → | NVIDIA Dynamo |
| Ollama | 무료 | MIT | macOS, Windows, Linux | 로컬 | 모델에 따라 다름 | — | — | — | — | — | — | — | 리뷰 읽기 → | Ollama |
| OlliteRT | 무료 | Apache-2.0 | Android | 로컬 | CPU만으로 충분 | — | 예 | — | — | — | 예 | — | 리뷰 읽기 → | OlliteRT |
| oMLX | 무료 | Apache-2.0 | macOS | 로컬 | 모델에 따라 다름 | v0.6.4 | 예 | — | 예 | — | — | 예 | 리뷰 읽기 → | oMLX |
| OpenLLM | 무료 | Apache-2.0 | — | 하이브리드 | 모델에 따라 다름 | — | 예 | — | — | — | — | — | 리뷰 읽기 → | OpenLLM |
| Rapid-MLX | 무료 | Apache-2.0 | macOS | 로컬 | RAM 8 GB | — | 예 | — | 예 | — | — | — | 리뷰 읽기 → | Rapid-MLX |
| SGLang | 무료 | Apache-2.0 | Linux | 로컬 | 모델에 따라 다름 | — | — | 예 | — | 예 | 예 | 예 | 리뷰 읽기 → | SGLang |
| Shimmy | 무료 | Apache-2.0 | macOS, Windows, Linux | 로컬 | 모델에 따라 다름 | — | 예 | 예 | 예 | 예 | — | — | 리뷰 읽기 → | Shimmy |
| SwiftLM | 무료 | MIT | macOS, iOS | 로컬 | 모델에 따라 다름 | — | 예 | — | 예 | — | — | — | 리뷰 읽기 → | SwiftLM |
| TensorRT-LLM | 무료 | Apache-2.0 | Windows, Linux | 로컬 | 모델에 따라 다름 | — | — | 예 | — | — | — | — | 리뷰 읽기 → | TensorRT-LLM |
| text-generation-webui | 무료 | AGPL-3.0 | Windows, Linux, macOS | 로컬 | 모델에 따라 다름 | — | 예 | 예 | 예 | 예 | 예 | — | 리뷰 읽기 → | text-generation-webui |
| TurboFieldfare | 무료 | Apache-2.0 | macOS | 로컬 | RAM 2 GB | — | — | — | 예 | — | — | — | 리뷰 읽기 → | TurboFieldfare |
| vLLM | 무료 | Apache-2.0 | Linux | 로컬 | 모델에 따라 다름 | — | 예 | 예 | — | 예 | 예 | 예 | 리뷰 읽기 → | vLLM |
| vllm-mlx | 무료 | Apache-2.0 | macOS | 로컬 | 모델에 따라 다름 | — | 예 | — | 예 | — | — | — | 리뷰 읽기 → | vllm-mlx |
"—"는 프로젝트 자체 문서에 해당 내용이 명시되어 있지 않다는 뜻이며, 기능이 없다는 뜻이 아닙니다. 값은 각 프로젝트의 공식 README 또는 사이트에서 가져왔으며, 도구의 리뷰가 갱신될 때 다시 확인합니다.
추론 엔진: 무엇이 다른가
- OpenAI 호환 API. candle-vllm, NVIDIA Dynamo, exo, KoboldCpp, KServe, llama.cpp, LocalAI, LoRAX, Lucebox, MLC LLM, mlx-serve, mlxcel, OlliteRT, oMLX, OpenLLM, Rapid-MLX, Shimmy, SwiftLM, text-generation-webui, vllm-mlx, vLLM은 OpenAI 호환 HTTP API를 문서화하고 있어, OpenAI API용으로 만든 앱이 이들을 가리키도록 설정할 수 있습니다.
- NVIDIA GPU. candle-vllm, ExLlamaV2, KoboldCpp, llama.cpp, LMDeploy, LocalAI, LoRAX, Lucebox, MLC LLM, mlxcel, SGLang, Shimmy, TensorRT-LLM, text-generation-webui, vLLM은 NVIDIA GPU(CUDA) 지원을 문서화하고 있습니다.
- Apple Silicon. candle-vllm, claude-code-local, exo, KoboldCpp, llama.cpp, LocalAI, MLC LLM, MLX-LM, mlx-serve, mlxcel, oMLX, Rapid-MLX, Shimmy, SwiftLM, text-generation-webui, TurboFieldfare, vllm-mlx는 Apple Silicon, Metal 또는 MLX 지원을 문서화하고 있습니다.
- AMD GPU. KoboldCpp, llama.cpp, LocalAI, Lucebox, MLC LLM, SGLang, Shimmy, text-generation-webui, vLLM은 AMD GPU 지원을 문서화하고 있습니다.
- CPU 추론. exo, KoboldCpp, llama.cpp, LocalAI, OlliteRT, SGLang, text-generation-webui, vLLM은 CPU에서 추론을 실행하는 방법을 문서화하고 있습니다.
- 멀티 GPU 및 멀티 노드. candle-vllm, NVIDIA Dynamo, ExLlamaV2, exo, KServe, LMDeploy, LocalAI, LoRAX, Lucebox, MLX-LM, mlxcel, oMLX, SGLang, vLLM은 멀티 GPU, 텐서 병렬 또는 멀티 노드 추론을 문서화하고 있습니다.
- 라이선스. 여기 있는 엔진 대부분은 Apache-2.0(19개) 또는 MIT(9개)이며, KoboldCpp와 text-generation-webui는 AGPL-3.0입니다. 카피레프트 라이선스는 수정본을 배포할 때 조건을 붙입니다. AI 도구 라이선스 설명을 참고하세요.
런타임과 매니저: 무엇이 다른가
- OpenAI 호환 API. Docker Model Runner, Foundry Local, GPUStack, Jan, Lemonade, Osaurus는 OpenAI 호환 API를 문서화하고 있습니다.
- 데스크톱 앱. GPT4All, Jan, LM Studio, Osaurus, Ypipe는 설치형 데스크톱 앱을 문서화하고 있습니다.
- 내장 모델 라이브러리. Foundry Local, GPUStack, Jan, Lemonade, LM Studio, Ollama는 모델을 찾고 내려받는 내장 기능을 문서화하고 있습니다.
- 헤드리스 또는 서버 모드. DreamServer, GPUStack, Lemonade, Osaurus는 GUI 없이 백그라운드 서비스 또는 서버로 실행하는 방법을 문서화하고 있습니다.
- 라이선스와 가격. 여기 있는 런타임 중 네 개는 Apache-2.0이고 네 개는 MIT입니다. LM Studio와 Docker Model Runner는 독점 소프트웨어이며(LM Studio는 무료로 사용할 수 있고, Docker Model Runner는 Docker Desktop에 포함되어 있습니다), Msty는 무료 티어가 있는 비공개 소스이고, RunAnywhere와 YPipe는 자체 약관을 사용하거나 약관이 문서화되어 있지 않습니다. 각 리뷰에서 확인하세요.
라우터와 게이트웨이: 무엇이 다른가
- OpenAI 호환 엔드포인트. AIClient2API와 litellm은 OpenAI 호환 엔드포인트를 문서화하고 있습니다.
- 로컬 모델로의 라우팅. litellm은 지원하는 프로바이더 중에 로컬 또는 셀프 호스팅 모델(예: Ollama)이 있다고 문서화하고 있습니다.
- 폴백과 로드 밸런싱. AIClient2API, ClawRouter, litellm은 모델 또는 프로바이더 간의 폴백, 재시도 또는 로드 밸런싱을 문서화하고 있습니다.
- 라이선스. 4개 중 2개는 MIT, 1개는 GPL-3.0, 1개는 Apache-2.0입니다.
이 비교로는 알 수 없는 것
- 이 비교는 성능이 아니라 문서화된 기능을 비교합니다. 초당 토큰 수, 메모리 사용량, 지연 시간에 대해서는 아무것도 알려 주지 않습니다. PromptQuorum은 이 도구들에 대해 이를 측정하지 않았으며, 결과는 하드웨어와 모델에 크게 좌우됩니다.
- 대시는 우리가 확인한 문서의 공백일 뿐 부정적인 결론이 아닙니다. 일부 도구는 README에 언급하지 않은 기능을 지원할 수도 있으며, README가 짧아 명시된 내용이 적은 몇몇 널리 쓰이는 도구(예: Ollama의 엔진 기능)에서 이런 경우가 가장 두드러집니다.
- 하드웨어 지원은 문서에 명시된 내용이지 해당 하드웨어에서 좋은 사용 경험을 보장하는 것이 아닙니다. 실제 요구 사항은 해당 도구의 리뷰를 읽어 보세요.
- 도구는 빠르게 바뀝니다. 각 도구의 리뷰에는 확인한 기준 버전이 명시되어 있으며, 이 가이드는 리뷰가 갱신될 때 함께 갱신됩니다.
자주 묻는 질문
추론 엔진, 런타임, 게이트웨이는 무엇이 다른가요?
추론 엔진은 자신의 하드웨어에서 모델을 실행합니다(예: llama.cpp, vLLM). 런타임 또는 매니저는 모델을 내려받아 대신 실행해 주며, 데스크톱 앱이나 모델 라이브러리를 갖추는 경우가 많습니다(예: Ollama, LM Studio). 라우터 또는 게이트웨이는 하나 이상의 모델이나 프로바이더 앞단에 놓여 요청을 전달합니다. 서로 하는 일이 다르기 때문에 따로 비교합니다.
비교표의 대시는 무슨 뜻인가요?
프로젝트 자체 문서에 해당 속성이 명시되어 있지 않다는 뜻입니다. 기능이 없다는 뜻은 아니므로, 해당 도구의 리뷰나 저장소를 확인하세요.
Ollama가 왜 두 그룹에 있나요?
Ollama는 추론 엔진이면서 모델을 관리하는 런타임이기도 해서 양쪽에 모두 등록되어 있습니다. 이 표에서 비교하는 속성 중 README에 명시된 것이 적어 많은 셀이 대시로 표시됩니다.
이 도구들 중에 제휴 링크가 있는 것이 있나요?
아니요. 이 글을 작성한 시점에 PromptQuorum은 이 비교에 포함된 어떤 도구와도 제휴 관계가 없으며, 여기 있는 어떤 링크도 수수료를 받지 않습니다.
이 비교는 얼마나 자주 업데이트되나요?
연 2회, 그리고 나열된 도구의 리뷰가 갱신될 때마다 업데이트됩니다. 표가 그 리뷰들과 동일한 데이터로 생성되기 때문입니다.
출처
- 각 도구의 공식 README 또는 웹사이트. 해당 도구의 PromptQuorum 리뷰에 나열되어 있습니다(비교표에서 연결).
- PromptQuorum 로컬 AI 앱 디렉터리 — 표의 각 행이 생성되는 바탕이 되는 레코드입니다.
- AI 도구 라이선스 설명 — 위에서 언급한 라이선스 계열의 의미를 설명합니다.