Skip to main content
PromptQuorum
/고급 로컬 LLM/로컬 추론 엔진·런타임·게이트웨이 비교(2026): 모델 실행과 서빙
Overview & Reference

로컬 추론 엔진·런타임·게이트웨이 비교(2026): 모델 실행과 서빙

·10분 읽기·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

PromptQuorum 디렉터리에 있는 로컬 실행·서빙 도구 46개는 서로 따로 비교해야 하는 세 종류로 나뉩니다. 추론 엔진(30개), 런타임과 매니저(13개), 라우터와 게이트웨이(4개)입니다. 엔진 중 15개는 NVIDIA GPU 지원을, 17개는 Apple Silicon 지원을, 21개는 OpenAI 호환 API를 문서화하고 있으며, 런타임 중 6개는 OpenAI 호환 API를 문서화하고 있습니다. 아래 비교표를 활용하되, 설치하기 전에 각 도구의 리뷰를 읽어 보세요.

자신의 하드웨어에서 모델을 실행하려면 세 종류의 도구가 필요합니다. 모델을 실제로 구동하는 추론 엔진, 모델을 대신 내려받아 실행해 주는 런타임과 매니저, 그리고 그 앞단에 놓이는 라우터와 게이트웨이입니다. 하나의 기능 목록으로는 이들을 공정하게 비교할 수 없습니다. 이 가이드는 무료 및 프리미엄(freemium) 도구 46개를 종류별로 나누어 비교하며, 비교표는 각 도구의 PromptQuorum 리뷰와 동일한 데이터로 생성되므로 표와 리뷰가 서로 어긋날 수 없습니다.

이 페이지에는 타사 제품에 대한 참조 링크가 포함되어 있습니다. PromptQuorum은 어떤 제휴 프로그램에도 등록되어 있지 않습니다 — 이는 수수료가 발생하지 않는 일반 링크입니다. 링크 클릭 및 이후 단계는 전적으로 귀하의 책임입니다. 이 링크는 PromptQuorum의 어떠한 보증이나 검증을 나타내지 않습니다.

핵심 요점

  • 도구 46개, 세 종류: 추론 엔진(30개), 런타임과 매니저(13개), 라우터와 게이트웨이(4개). Ollama는 엔진이자 런타임이므로 두 그룹에 모두 나타납니다.
  • 표는 각 도구의 레코드로 생성되고 공식 README 또는 사이트와 대조해 확인했습니다. 대시는 "문서에 명시되지 않음"을 뜻하며 "아니오"를 뜻하지 않습니다. 잘 알려진 일부 도구는 여기서 인용한 문서에 특정 기능에 대한 언급이 없어 해당 셀이 대시로 표시됩니다.
  • 표의 모든 도구 이름은 해당 도구의 PromptQuorum 리뷰로 연결되며, 설치 단계와 한계는 그 리뷰에서 다룹니다.

📍 한 문장으로

모델을 로컬에서 실행하려면 추론 엔진, 런타임과 매니저, 라우터와 게이트웨이라는 세 종류의 도구가 필요하므로, PromptQuorum 디렉터리의 도구 46개를 종류별로 나누어 비교하며, 비교표는 각 도구의 리뷰와 동일한 도구 데이터로 생성됩니다.

💬 쉽게 말하면

엔진은 모델을 실제로 구동하는 부분이고, 런타임이나 매니저는 모델을 대신 내려받아 실행해 주며, 게이트웨이는 그 사이에서 요청을 전달합니다. 엔진과 게이트웨이를 GPU 지원 여부로 비교하는 것은 의미가 없으므로, 이 가이드는 같은 종류끼리 비교합니다.

비교 방법

각 도구의 사실 정보, 즉 가격, 라이선스, 플랫폼, 하드웨어 요건, 카테고리별 속성은 해당 도구의 디렉터리 레코드에 한 번만 저장됩니다. 아래 비교표는 이 레코드로 생성되고 도구별 리뷰도 같은 레코드를 바탕으로 작성되므로, 두 곳이 서로 다른 값을 표기할 수 없습니다.

카테고리별 속성(예: OpenAI 호환 API 또는 AMD GPU 지원)은 각 프로젝트의 공식 README 또는 웹사이트에서 가져와 그곳의 정확한 표현과 대조해 확인했습니다. 문서에 언급이 없는 경우 표에는 추측하지 않고 대시를 표시합니다. 주장에 단서가 붙는 경우(실험적, 계획 중, 또는 별도 프로젝트를 통해서만 제공)에는 해당 속성을 표에서 제외하고 그 도구의 리뷰에서 다룹니다.

자체 PromptQuorum 리뷰가 있는 도구만 표에 포함됩니다. API 서버로만 등록된 도구(h2oGPT, Tabby, OpenAI Edge TTS)는 각자의 카테고리에서 비교합니다. 이 비교는 자신의 하드웨어에서 실행되는 도구를 나열할 뿐 순위를 매기지 않습니다. 적합한 도구는 각자의 조건에 따라 달라지기 때문입니다.

비교표

아래에서 도구 종류를 선택한 다음 행을 따라 읽으세요. 도구 이름을 클릭하면 해당 PromptQuorum 리뷰 전문이 열립니다.

도구가격라이선스플랫폼실행 방식하드웨어버전OpenAI 호환 APINVIDIA GPUApple SiliconAMD GPUCPU 추론멀티 GPU / 멀티 노드리뷰제품 링크 · 공개됨
candle-vllm무료MITmacOS, Windows, Linux로컬모델에 따라 다름v0.9.1리뷰 읽기candle-vllm
claude-code-local무료MITmacOS로컬모델에 따라 다름v0.3.0리뷰 읽기claude-code-local
ExLlamaV2무료MITWindows, Linux로컬VRAM 8 GBv0.3.2리뷰 읽기ExLlamaV2
exo무료Apache-2.0macOS, Linux로컬모델에 따라 다름리뷰 읽기exo
KoboldCpp무료AGPL-3.0Windows, Linux, macOS로컬모델에 따라 다름v1.121리뷰 읽기KoboldCpp
KServe무료Apache-2.0Linux로컬CPU만으로 충분v0.20.0리뷰 읽기KServe
llama.cpp무료MITmacOS, Windows, Linux로컬모델에 따라 다름v0.4.1리뷰 읽기llama.cpp
Llamafile무료Apache-2.0macOS, Windows, Linux로컬모델에 따라 다름0.10.6리뷰 읽기Llamafile
LMDeploy무료Apache-2.0Linux로컬모델에 따라 다름v0.17.0리뷰 읽기LMDeploy
LocalAI무료MITmacOS, Windows, Linux로컬모델에 따라 다름리뷰 읽기LocalAI
LoRAX무료Apache-2.0Linux로컬모델에 따라 다름v0.12.1리뷰 읽기LoRAX
Lucebox무료Apache-2.0Linux로컬모델에 따라 다름리뷰 읽기Lucebox
MLC LLM무료Apache-2.0macOS, Windows, Linux, iOS, Android로컬모델에 따라 다름리뷰 읽기MLC LLM
MLX-LM무료MITmacOS로컬모델에 따라 다름리뷰 읽기MLX-LM
mlx-serve무료MITmacOS로컬모델에 따라 다름v26.9.4리뷰 읽기mlx-serve
mlxcel무료Apache-2.0macOS, Linux로컬모델에 따라 다름v0.7.0리뷰 읽기mlxcel
NVIDIA Dynamo무료Apache-2.0Linux로컬모델에 따라 다름v1.4–v1.6리뷰 읽기NVIDIA Dynamo
Ollama무료MITmacOS, Windows, Linux로컬모델에 따라 다름리뷰 읽기Ollama
OlliteRT무료Apache-2.0Android로컬CPU만으로 충분리뷰 읽기OlliteRT
oMLX무료Apache-2.0macOS로컬모델에 따라 다름v0.6.4리뷰 읽기oMLX
OpenLLM무료Apache-2.0하이브리드모델에 따라 다름리뷰 읽기OpenLLM
Rapid-MLX무료Apache-2.0macOS로컬RAM 8 GB리뷰 읽기Rapid-MLX
SGLang무료Apache-2.0Linux로컬모델에 따라 다름리뷰 읽기SGLang
Shimmy무료Apache-2.0macOS, Windows, Linux로컬모델에 따라 다름리뷰 읽기Shimmy
SwiftLM무료MITmacOS, iOS로컬모델에 따라 다름리뷰 읽기SwiftLM
TensorRT-LLM무료Apache-2.0Windows, Linux로컬모델에 따라 다름리뷰 읽기TensorRT-LLM
text-generation-webui무료AGPL-3.0Windows, Linux, macOS로컬모델에 따라 다름리뷰 읽기text-generation-webui
TurboFieldfare무료Apache-2.0macOS로컬RAM 2 GB리뷰 읽기TurboFieldfare
vLLM무료Apache-2.0Linux로컬모델에 따라 다름리뷰 읽기vLLM
vllm-mlx무료Apache-2.0macOS로컬모델에 따라 다름리뷰 읽기vllm-mlx

"—"는 프로젝트 자체 문서에 해당 내용이 명시되어 있지 않다는 뜻이며, 기능이 없다는 뜻이 아닙니다. 값은 각 프로젝트의 공식 README 또는 사이트에서 가져왔으며, 도구의 리뷰가 갱신될 때 다시 확인합니다.

추론 엔진: 무엇이 다른가

런타임과 매니저: 무엇이 다른가

  • OpenAI 호환 API. Docker Model Runner, Foundry Local, GPUStack, Jan, Lemonade, Osaurus는 OpenAI 호환 API를 문서화하고 있습니다.
  • 데스크톱 앱. GPT4All, Jan, LM Studio, Osaurus, Ypipe는 설치형 데스크톱 앱을 문서화하고 있습니다.
  • 내장 모델 라이브러리. Foundry Local, GPUStack, Jan, Lemonade, LM Studio, Ollama는 모델을 찾고 내려받는 내장 기능을 문서화하고 있습니다.
  • 헤드리스 또는 서버 모드. DreamServer, GPUStack, Lemonade, Osaurus는 GUI 없이 백그라운드 서비스 또는 서버로 실행하는 방법을 문서화하고 있습니다.
  • 라이선스와 가격. 여기 있는 런타임 중 네 개는 Apache-2.0이고 네 개는 MIT입니다. LM Studio와 Docker Model Runner는 독점 소프트웨어이며(LM Studio는 무료로 사용할 수 있고, Docker Model Runner는 Docker Desktop에 포함되어 있습니다), Msty는 무료 티어가 있는 비공개 소스이고, RunAnywhere와 YPipe는 자체 약관을 사용하거나 약관이 문서화되어 있지 않습니다. 각 리뷰에서 확인하세요.

라우터와 게이트웨이: 무엇이 다른가

  • OpenAI 호환 엔드포인트. AIClient2APIlitellm은 OpenAI 호환 엔드포인트를 문서화하고 있습니다.
  • 로컬 모델로의 라우팅. litellm은 지원하는 프로바이더 중에 로컬 또는 셀프 호스팅 모델(예: Ollama)이 있다고 문서화하고 있습니다.
  • 폴백과 로드 밸런싱. AIClient2API, ClawRouter, litellm은 모델 또는 프로바이더 간의 폴백, 재시도 또는 로드 밸런싱을 문서화하고 있습니다.
  • 라이선스. 4개 중 2개는 MIT, 1개는 GPL-3.0, 1개는 Apache-2.0입니다.

이 비교로는 알 수 없는 것

  • 이 비교는 성능이 아니라 문서화된 기능을 비교합니다. 초당 토큰 수, 메모리 사용량, 지연 시간에 대해서는 아무것도 알려 주지 않습니다. PromptQuorum은 이 도구들에 대해 이를 측정하지 않았으며, 결과는 하드웨어와 모델에 크게 좌우됩니다.
  • 대시는 우리가 확인한 문서의 공백일 뿐 부정적인 결론이 아닙니다. 일부 도구는 README에 언급하지 않은 기능을 지원할 수도 있으며, README가 짧아 명시된 내용이 적은 몇몇 널리 쓰이는 도구(예: Ollama의 엔진 기능)에서 이런 경우가 가장 두드러집니다.
  • 하드웨어 지원은 문서에 명시된 내용이지 해당 하드웨어에서 좋은 사용 경험을 보장하는 것이 아닙니다. 실제 요구 사항은 해당 도구의 리뷰를 읽어 보세요.
  • 도구는 빠르게 바뀝니다. 각 도구의 리뷰에는 확인한 기준 버전이 명시되어 있으며, 이 가이드는 리뷰가 갱신될 때 함께 갱신됩니다.

자주 묻는 질문

추론 엔진, 런타임, 게이트웨이는 무엇이 다른가요?

추론 엔진은 자신의 하드웨어에서 모델을 실행합니다(예: llama.cpp, vLLM). 런타임 또는 매니저는 모델을 내려받아 대신 실행해 주며, 데스크톱 앱이나 모델 라이브러리를 갖추는 경우가 많습니다(예: Ollama, LM Studio). 라우터 또는 게이트웨이는 하나 이상의 모델이나 프로바이더 앞단에 놓여 요청을 전달합니다. 서로 하는 일이 다르기 때문에 따로 비교합니다.

비교표의 대시는 무슨 뜻인가요?

프로젝트 자체 문서에 해당 속성이 명시되어 있지 않다는 뜻입니다. 기능이 없다는 뜻은 아니므로, 해당 도구의 리뷰나 저장소를 확인하세요.

Ollama가 왜 두 그룹에 있나요?

Ollama는 추론 엔진이면서 모델을 관리하는 런타임이기도 해서 양쪽에 모두 등록되어 있습니다. 이 표에서 비교하는 속성 중 README에 명시된 것이 적어 많은 셀이 대시로 표시됩니다.

이 도구들 중에 제휴 링크가 있는 것이 있나요?

아니요. 이 글을 작성한 시점에 PromptQuorum은 이 비교에 포함된 어떤 도구와도 제휴 관계가 없으며, 여기 있는 어떤 링크도 수수료를 받지 않습니다.

이 비교는 얼마나 자주 업데이트되나요?

연 2회, 그리고 나열된 도구의 리뷰가 갱신될 때마다 업데이트됩니다. 표가 그 리뷰들과 동일한 데이터로 생성되기 때문입니다.

출처

  • 각 도구의 공식 README 또는 웹사이트. 해당 도구의 PromptQuorum 리뷰에 나열되어 있습니다(비교표에서 연결).
  • PromptQuorum 로컬 AI 앱 디렉터리 — 표의 각 행이 생성되는 바탕이 되는 레코드입니다.
  • AI 도구 라이선스 설명 — 위에서 언급한 라이선스 계열의 의미를 설명합니다.

← 고급 로컬 LLM으로 돌아가기