Skip to main content
PromptQuorum
/고급 로컬 LLM/vllm-mlx 리뷰: Apple Silicon을 위한 vLLM 방식 서빙
Overview & Reference

vllm-mlx 리뷰: Apple Silicon을 위한 vLLM 방식 서빙

·11분 읽기·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

**vllm-mlx는 Apple Silicon Mac에서 대규모 언어 모델을 로컬로 실행하며, 하나의 프로세스에서 OpenAI 호환(/v1/*)과 Anthropic 호환(/v1/messages) 엔드포인트를 모두 제공하는 무료 오픈소스(Apache 2.0) 추론 서버입니다.** 독립 개발자 Way Barrios가 만들었으며 PyPI에 vllm-mlx라는 이름으로 배포되어 있습니다. 공식 vLLM 프로젝트가 아니라, vLLM의 서빙 기법(continuous batching, paged KV 캐시, prefix 캐싱)을 Apple의 Metal 기반 통합 메모리 아키텍처에 맞게 적용한 비공식 MLX 네이티브 포팅 버전으로, M1부터 M5까지의 Apple Silicon 칩에서 동작합니다.

vllm-mlx(github.com/waybarrios/vllm-mlx)는 Apple의 네이티브 MLX 프레임워크를 통해 vLLM 방식의 continuous batching, paged KV 캐싱, prefix 캐싱을 Apple Silicon Mac에 제공하는 무료 오픈소스 Python 기반 추론 서버입니다. 개발자 Way Barrios가 만든 독립적인 커뮤니티 프로젝트로, 공식 vLLM 프로젝트가 아니며 vLLM 팀과 제휴 관계도 없습니다. 다만 API 설계와 일부 서빙 기법은 명시적으로 vLLM에서 영감을 받았습니다. 이 리뷰에서는 실제로 무엇을 할 수 있는지, 어떻게 설치하는지, 어떤 사람에게 적합한지 다룹니다.

핵심 요점

  • vllm-mlx(github.com/waybarrios/vllm-mlx)는 무료 오픈소스 추론 서버로, pip install vllm-mlx로 설치합니다
  • 독립 개발자 Way Barrios가 개발했으며, 공식 vLLM 프로젝트(github.com/vllm-project/vllm)가 아니고 vLLM 팀과 제휴 관계도 없습니다
  • Apache 2.0 라이선스이며, GitHub 저장소의 LICENSE 파일을 통해 확인되었습니다
  • 하나의 서버 프로세스에서 OpenAI 호환(/v1/chat/completions, /v1/embeddings, /v1/rerank, /v1/responses)과 Anthropic 호환(/v1/messages) 엔드포인트를 제공합니다
  • vLLM에서 적용한 서빙 기능: continuous batching, paged KV 캐시, prefix 캐싱, 긴 컨텍스트 워크로드를 위한 선택적 SSD 계층 캐시
  • Apple Silicon상의 네이티브 MLX를 통해 텍스트, 비전(이미지/동영상), 오디오(TTS/STT), 임베딩/재순위 모델을 모두 처리합니다
  • Apple Silicon Mac(M1~M5)이 필수이며, Windows, Linux, Intel Mac은 지원하지 않습니다
  • 이 리뷰 작성 시점 기준 GitHub 스타 1,580개 이상 보유

📍 한 문장으로

vllm-mlx는 네이티브 MLX를 통해 vLLM 방식의 continuous batching과 paged KV 캐싱을 Apple Silicon Mac에 제공하며, OpenAI 호환 및 Anthropic 호환 API 엔드포인트를 모두 노출하는 무료 오픈소스(Apache 2.0) Python 기반 추론 서버입니다.

💬 쉽게 말하면

vllm-mlx를 사용하면 자신의 Mac에서 AI 모델을 실행하고, OpenAI나 Anthropic의 클라우드 API에 말을 거는 것과 동일한 방식으로 대화할 수 있습니다 — 기존 코드가 가리키는 주소를 클라우드 대신 localhost로만 바꾸면 됩니다. 이름의 "vLLM 방식" 부분이 뜻하는 대로 여러 요청을 동시에 효율적으로 처리하도록 설계되었지만, Mac에서 실행되는 vLLM 자체가 아니라 별도의 비공식 프로젝트입니다.

📌참고: 이 리뷰는 vllm-mlx의 GitHub 저장소, README, 문서 사이트, PyPI 패키지 정보를 바탕으로 작성되었습니다. vllm-mlx가 자체적으로 공개한 처리량 벤치마크는 독립적으로 검증된 사실로 다루지 않습니다 — 해당 수치는 프로젝트 자체 README에서 나온 것으로, PromptQuorum이 직접 테스트한 결과가 아니라 개발자가 보고한 수치로 취급해야 합니다. 이 리뷰는 Local LLM Software Directory에 등재된 vllm-mlx 항목의 심화 버전입니다.

vllm-mlx란 무엇인가?

vllm-mlx는 Apple Silicon Mac용 명령줄 추론 서버로, OpenAI 및 Anthropic 클라우드 서비스와 동일한 API 형식을 통해 로컬에서 실행되는 AI 모델을 노출합니다. 자체 GitHub README에서는 "하나의 서버에서 continuous batching + OpenAI + Anthropic API"를 결합하고 "네이티브 Apple Silicon 추론"을 제공한다고 설명합니다. 그래픽 데스크톱 애플리케이션이 아니라 터미널에서 실행하는 Python 패키지이며, 실행 후에는 로컬 포트에서 API 요청을 수신 대기합니다.

  • 제품 유형: pip/uv 패키지로 설치하는 Python 기반 CLI 추론 서버로, 다운로드형 GUI 앱이 아닙니다
  • 제작자: 독립 개발자 Way Barrios(GitHub 계정 waybarrios)이며, 이 리뷰에서는 프로젝트 뒤에 기업, 투자 라운드, 상업적 실체가 있다는 증거를 찾지 못했습니다
  • 저장소: github.com/waybarrios/vllm-mlx로, GitHub에 존재하는 동일 이름의 여러 저장소 중 가장 오래되고 스타가 가장 많은 저장소입니다 — 다른 사용자명 아래 같은 이름을 가진 다른 저장소들은 이 저장소를 자신들이 미러링하는 원본 프로젝트로 설명하고 있습니다
  • 라이선스: Apache 2.0이며, 저장소의 LICENSE 파일을 통해 확인되었습니다
  • 명칭: "vllm-mlx"라는 이름은 이 프로젝트가 vLLM의 서빙 API 설계와 용어(continuous batching, paged KV 캐시)를 따르면서도, vLLM 자체의 CUDA/ROCm 기반 엔진이 아닌 MLX 위에서 동작함을 나타냅니다 — vLLM의 원본 코드베이스는 포함되어 있지 않습니다

프로젝트 역사

vllm-mlx는 비교적 젊은 프로젝트입니다. PyPI 패키지 페이지와 GitHub 저장소는 다년간에 걸친 긴 버전 이력보다는 활발하고 지속적인 개발이 이루어지고 있음을 보여주며, README는 이미 OpenAI 및 Anthropic API 호환성, continuous batching, 멀티모달 지원, MCP 도구 호출 등 폭넓은 기능을 단계적 출시가 아닌 현재 상태로 문서화하고 있습니다.

  • PyPI에 vllm-mlx 패키지로 배포되며, pip index versions vllm-mlx 명령이나 PyPI 프로젝트 페이지에서 공개된 버전 태그를 확인할 수 있습니다
  • 활발히 유지 관리됨: GitHub 저장소에서 지속적인 커밋이 확인되며, vllm-mlx.is-a.dev에 문서 사이트가 있습니다
  • README는 프로젝트 자체에서 여러 언어(영어, 스페인어, 프랑스어, 중국어)로 번역되어 있으며, 이는 이 규모의 프로젝트로서는 이례적이고 국제적으로 분산된 사용자 기반을 시사하는 신호입니다
  • 이 리뷰 작성 시점 기준, 기능 범위에는 이미 추론 모델 지원(Qwen3, DeepSeek-R1 방식의 추론 추출), 추측 디코딩, Mixture-of-Experts 최적화가 포함되어 있습니다

vllm-mlx로 무엇을 할 수 있는가?

vllm-mlx의 기능 구성은 단순 텍스트 생성을 넘어서면서도 단일 Mac에서 여러 동시 요청을 효율적으로 서빙하는 데 중점을 둡니다. 프로젝트 자체 README문서 사이트에 따라 각 기능이 실제로 무엇을 하는지 정리했습니다.

  • 이중 API 호환성 — 실행 중인 하나의 서버에서 OpenAI 방식(/v1/chat/completions, /v1/completions, /v1/embeddings, /v1/rerank, /v1/responses)과 Anthropic 방식(스트리밍, 도구 사용, 시스템 프롬프트를 지원하는 /v1/messages) 엔드포인트를 모두 제공합니다
  • Continuous batching — 여러 동시 요청을 하나씩 처리하지 않고 함께 처리합니다. vLLM이 GPU 서빙에서 널리 알린 것과 동일한 기법을 MLX/Metal에 맞게 적용한 것입니다
  • Paged 및 prefix KV 캐싱 — trie 기반의 메모리 효율적인 캐시로, 요청들 사이에서 반복되는 프롬프트 접두사를 공유하며, 긴 컨텍스트 에이전트 워크로드를 위해 캐시를 디스크로 옮기는 선택적 --ssd-cache-dir 플래그를 제공합니다
  • 멀티모달 지원 — 하나의 서버에서 텍스트, 이미지, 동영상, 오디오 입력을 받습니다. 문서화된 호환 비전 모델 계열에는 Gemma, Qwen3-VL, Pixtral, Llama 비전 변형이 포함됩니다
  • 내장 오디오 기능 — README에 따르면 여러 음성과 언어를 지원하는 텍스트 음성 변환(TTS)과, Whisper 계열 모델을 통한 음성 텍스트 변환(STT)을 동일한 서버 프로세스 내에서 실행합니다
  • MCP 도구 호출 — Model Context Protocol을 지원하며 여러 모델 계열용 파서를 제공합니다(README에는 OpenAI, Anthropic, Gemini, Qwen, DeepSeek, Gemma 방식의 도구 호출 형식이 나열되어 있습니다). 또한 Anthropic 호환 엔드포인트를 통한 명시적인 Claude Code 호환성을 제공합니다
  • 추론 및 MoE 기능 — Qwen3, DeepSeek-R1 같은 모델을 위한 추론 토큰 추출과, 지원되는 모델 계열을 위한 Mixture-of-Experts 라우팅 옵션 및 추측 디코딩을 제공합니다
  • 관찰 가능성 및 벤치마킹 — 선택적 Prometheus /metrics 엔드포인트와, 처리량 측정을 실행하고 기록하기 위한 내장 vllm-mlx bench-serve 명령을 제공합니다

사용 예시: vllm-mlx를 활용하는 세 가지 방법

다음은 위에서 문서화한 vllm-mlx의 기능을 바탕으로 구성한 구체적인 워크플로로, 프로젝트 자체 README에 있는 명령을 사용합니다.

vllm-mlx 가격: vllm-mlx는 정말 무료인가?

네 — vllm-mlx에는 유료 요금제가 없습니다. 계정, 라이선스 키, 사용량 상한이 없는 무료 Apache 2.0 라이선스 PyPI 패키지로 배포됩니다. GitHub 저장소에는 가격 페이지가 없으며, README나 문서 어디에도 상업용 또는 엔터프라이즈 버전에 대한 설명이 없습니다.

  • vllm-mlx 자체를 설치하거나 실행하는 데 드는 비용은 없습니다 — pip install vllm-mlx가 거래의 전부입니다
  • Apache 2.0 라이선스는 라이선스의 표준 조건(저작자 표시 및 라이선스 고지 유지)을 준수하는 한 상업적 사용, 수정, 재배포를 허용합니다
  • 실질적으로 유일한 비용은 실행에 필요한 Apple Silicon Mac 하드웨어와, Hugging Face나 mlx-community 조직에서 별도로 다운로드하는 모델을 위한 디스크 공간뿐입니다
  • 이 리뷰에서는 개발자가 호스팅하는 클라우드 버전, 호스팅형 API, 관리형 서비스를 찾지 못했습니다 — vllm-mlx는 사용자가 직접 관리하는 하드웨어에서만 실행됩니다

vllm-mlx vs. mlx-lm

vllm-mlx와 mlx-lm은 둘 다 Apple의 MLX 프레임워크를 통해 모델을 실행하지만, 서로 다른 문제를 해결합니다. mlx-lm은 MLX 모델을 한 번에 하나씩 요청 단위로 실행하고 파인튜닝하기 위한 Apple 자체의 더 저수준 Python 라이브러리 및 CLI입니다. vllm-mlx는(자체 아키텍처 다이어그램에 따르면) mlx-lm, mlx-vlm, mlx-audio 같은 라이브러리 위에 구축된 더 고수준의 서버로, vLLM으로 잘 알려진 동시 요청 서빙 기능을 추가합니다.

유지 관리자

vllm-mlx:
독립 개발자(Way Barrios)
mlx-lm:
Apple의 MLX 팀

주요 사용 사례

vllm-mlx:
동시 요청용 API 서버
mlx-lm:
단일 요청 생성 및 파인튜닝 라이브러리

동시 배칭

vllm-mlx:
Continuous batching, paged KV 캐시
mlx-lm:
핵심 초점이 아님; 일반적으로 한 번에 하나의 요청 처리

API 범위

vllm-mlx:
OpenAI + Anthropic 호환 엔드포인트
mlx-lm:
Python API 및 CLI, Anthropic 형식의 내장 서버 없음

관계

vllm-mlx:
내부적으로 mlx-lm, mlx-vlm, mlx-audio 위에 구축됨
mlx-lm:
다른 MLX 도구들이 의존하는 기반 라이브러리

이는 각 프로젝트 자체 문서를 기반으로 한 사실적인 기능 비교이며, PromptQuorum이 수행한 벤치마크가 아닙니다. 두 도구는 엄밀한 의미의 경쟁 관계가 아닙니다 — vllm-mlx는 mlx-lm을 대체하는 것이 아니라 그 위에 의존합니다.

vllm-mlx는 누구에게 적합한가?

vllm-mlx는 단일 사용자용 채팅 앱이 아니라 프로덕션 방식의 동시 서빙을 원하는 Apple Silicon 개발자에게 적합합니다.

vllm-mlx 평가 시 흔한 오해

vllm-mlx에 관한 대부분의 혼란은 그 이름에서 비롯되며, 이 이름은 프로젝트 자체가 하지 않는 가정을 하도록 유도합니다.

경쟁 제품 및 대안

vllm-mlx는 oMLX, Rapid-MLX, mlxcel과 동일한 Apple Silicon 추론 서버 영역에 속합니다. 이들은 모두 MLX를 통해 로컬 모델을 실행하며 OpenAI 호환 또는 유사한 API 형태를 제공하는 독립 프로젝트로, 주로 언어(Python 대 Rust), 기능 중점, 캐싱 전략에서 차이가 있습니다.

도구
주요 특징
링크
oMLXSSD 기반 프롬프트 캐싱을 갖춘 Apple Silicon 추론 서버oMLX 리뷰
Rapid-MLX서빙 속도에 중점을 둔 네이티브 MLX 추론 서버Rapid-MLX 리뷰
mlxcelLLM, VLM, 임베딩, 오디오를 위한 Rust 네이티브 MLX 런타임mlxcel 리뷰
LoRAX하나의 GPU에서 하나의 베이스 모델로 수천 개의 LoRA 어댑터를 서빙LoRAX 리뷰

이 목록은 Apple Silicon 및 어댑터 서빙 추론 엔진 분야에서 흔히 비교되는 도구들을 반영한 것이며, PromptQuorum의 독자적인 순위가 아닙니다 — 선택하기 전에 각 도구의 현재 기능 구성을 확인하십시오.

자주 묻는 질문

vllm-mlx란 무엇입니까?

vllm-mlx(github.com/waybarrios/vllm-mlx)는 네이티브 MLX를 통해 Apple Silicon Mac에서 AI 모델을 실행하며, OpenAI 호환 및 Anthropic 호환 API 엔드포인트를 모두 노출하는 무료 오픈소스(Apache 2.0) 추론 서버입니다.

vllm-mlx는 vLLM과 같은 것입니까?

아닙니다. vllm-mlx는 vLLM의 서빙 개념(continuous batching, paged KV 캐시)을 Apple의 MLX 프레임워크에 맞게 적용한 독립적이고 비공식적인 프로젝트입니다. 공식 vLLM 프로젝트나 팀과 제휴 관계가 없으며, vLLM의 원본 코드베이스를 포함하지 않습니다.

vllm-mlx는 무료입니까?

네. pip install vllm-mlx로 무료로 설치할 수 있으며, Apache 2.0 라이선스이고, 유료 요금제, 계정, 사용량 상한이 없습니다.

vllm-mlx는 어떻게 설치합니까?

프로젝트 자체 README에 따라 pip install vllm-mlx 또는 uv tool install vllm-mlx를 실행하십시오. Apple Silicon Mac이 필요하며, Windows, Linux, Intel Mac은 지원하지 않습니다.

vllm-mlx는 Claude Code와 함께 작동합니까?

네. Anthropic 호환 /v1/messages 엔드포인트를 제공하므로, 이 프로젝트는 ANTHROPIC_BASE_URL을 로컬에서 서빙되는 vllm-mlx 엔드포인트로 지정하는 방식으로 명시적인 Claude Code 지원을 문서화하고 있습니다.

vllm-mlx에는 어떤 하드웨어가 필요합니까?

Apple Silicon Mac(M1, M2, M3, M4 또는 M5)이 필요합니다. MLX를 통해 Metal 커널을 사용하며, CPU 전용 폴백이나 Apple 이외 GPU 지원은 없습니다.

vllm-mlx는 누가 만들었습니까?

독립 개발자 Way Barrios(GitHub 계정 waybarrios)입니다. 이 리뷰에서는 이 프로젝트 뒤에 기업이나 투자 라운드가 있다는 증거를 찾지 못했습니다.

vllm-mlx는 비전 및 오디오 모델을 지원합니까, 아니면 텍스트만 지원합니까?

프로젝트 README에 따르면 텍스트, 비전(이미지/동영상), 오디오(텍스트 음성 변환 및 음성 텍스트 변환) 모델을 지원하며, 임베딩과 재순위도 지원합니다. 이 모든 기능은 동일한 프로세스에서 서빙됩니다.

continuous batching이란 무엇입니까?

vLLM이 널리 알린 서빙 기법으로, 여러 동시 요청을 하나씩 처리하지 않고 함께 처리하여 서버가 동시에 여러 요청을 처리할 때 처리량을 개선합니다. vllm-mlx는 이 개념을 Apple Silicon 상의 MLX에 맞게 적용했습니다.

PromptQuorum은 vllm-mlx의 벤치마크 주장을 독자적으로 검증했습니까?

아니요. 이 리뷰는 PromptQuorum의 실제 벤치마킹이 아니라, vllm-mlx 자체의 GitHub 저장소, README, 문서 사이트를 바탕으로 작성되었습니다. 프로젝트 README에 있는 처리량 수치는 자체 보고된 것입니다.

출처

← 고급 로컬 LLM으로 돌아가기