Skip to main content
PromptQuorum
/고급 로컬 LLM/mlx-serve 리뷰 2026: Apple Silicon용 네이티브 Zig 추론 서버
Overview & Reference

mlx-serve 리뷰 2026: Apple Silicon용 네이티브 Zig 추론 서버

·11분 읽기·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

mlx-serve는 Zig로 작성된 무료 오픈소스 추론 서버(소스는 github.com/ddalcu/mlx-serve)로, Apple Silicon Mac에서 AI 모델을 네이티브로 실행하며 단일 바이너리에서 OpenAI 호환, Anthropic 호환, Ollama 호환 API를 동시에 제공합니다. 유료 요금제는 존재하지 않습니다. GitHub의 LICENSE 파일은 MIT 라이선스이며 저작권자는 David Dalcu이고, 일부 번들 서드파티 구성 요소는 저장소의 NOTICE 파일에 명시된 Apache License 2.0을 따릅니다. mlx-serve는 Apple Silicon 하드웨어에서 macOS 26.2 이상을 요구하며, 지원되는 모델 계열에는 네이티브로 MLX에 디스패치하고 GGUF 모델에는 내장된 llama.cpp로 디스패치합니다. 또한 채팅, 에이전트 도구 호출, 미디어 생성을 위한 MLX Core라는 번들형 macOS 메뉴바 앱도 함께 제공합니다.

mlx-serve(github.com/ddalcu/mlx-serve)는 Zig로 작성된 무료 오픈소스 추론 서버로, Apple Silicon Mac에서 대규모 언어 모델을 네이티브로 실행하며 약 7MB의 단일 바이너리에서 OpenAI, Anthropic, Ollama 호환 API를 Python 런타임 없이 제공합니다. 네이티브 Apple Silicon 모델에는 MLX로 디스패치하고 GGUF 모델에는 llama.cpp를 내장하며, 채팅과 에이전트 워크플로우, 미디어 생성을 위한 MLX Core라는 번들형 macOS 메뉴바 동반 앱도 함께 제공합니다. 이 리뷰는 mlx-serve가 실제로 무엇을 하는지, 설치 방법, 실제 기능 구성, 그리고 MLX 생태계의 다른 추론 서버들과 비교했을 때의 위치를 다룹니다.

핵심 요점

  • mlx-serve는 무료이며 오픈소스입니다. 공식 GitHub LICENSE는 MIT 라이선스이며, 일부 번들 서드파티 구성 요소는 Apache License 2.0을 따릅니다
  • 지원 모델 계열은 MLX를 통해 Apple Silicon에서 네이티브로 실행되며, GGUF 모델은 내장된 llama.cpp를 통해 실행됩니다
  • OpenAI 호환 chat/completions 및 Responses API, Anthropic Messages API, Ollama API를 하나의 포트에서 동시에 제공합니다
  • 번들형 macOS 메뉴바 동반 앱인 MLX Core를 제공하며, 다중 세션 채팅, MCP 도구를 지원하는 에이전트 모드, 이미지/동영상/음악/음성/3D 생성 패널을 갖추고 있습니다
  • Python 런타임 의존성이 없는 약 7MB의 단일 바이너리입니다
  • Claude Code, OpenCode, Cursor를 포함한 코딩 에이전트용 사전 구성된 실행기를 제공합니다
  • Apple Silicon(M 시리즈) 하드웨어에서 macOS 26.2 이상이 필요합니다 — Windows, Linux, Intel Mac은 지원하지 않습니다
  • David Dalcu가 개발했으며, 이 리뷰 작성 시점 기준 거의 매일 태그 릴리스가 이루어지고 있습니다

📍 한 문장으로

mlx-serve는 Apple Silicon Mac용 무료 오픈소스 Zig 추론 서버로, 단일 바이너리에서 OpenAI, Anthropic, Ollama 호환 API를 제공하며 유료 요금제는 없습니다.

💬 쉽게 말하면

로컬 모델 서버를 실행하기 위해 Python과 여러 개별 패키지를 설치하는 대신, mlx-serve는 Homebrew로 설치하는 하나의 작은 프로그램입니다. 지원 모델은 Apple의 MLX 프레임워크로 직접 실행하고, GGUF 모델의 경우 내장된 llama.cpp 사본으로 실행합니다. OpenAI, Anthropic, Ollama가 사용하는 것과 동일한 형식으로 요청에 응답하므로, 이러한 API를 위해 이미 구축된 도구들은 변경 없이 그대로 작동합니다.

📌참고: 이 리뷰는 로컬 LLM 소프트웨어 디렉터리에 수록된 mlx-serve 항목을 심층적으로 다룬 글입니다 — mlx-serve가 수십 개의 다른 로컬 AI 도구와 비교해 어떤 위치에 있는지 한눈에 보려면 해당 페이지를 참고하십시오.

mlx-serve란 무엇인가?

mlx-serve는 Apple Silicon Mac용 네이티브 추론 서버로, AI 모델을 기기 내에서 실행하고 OpenAI, Anthropic, Ollama 호환 API를 통해 노출합니다. GitHub 자체 설명에는 다음과 같이 적혀 있습니다. "Native LLM inference server for Apple Silicon. OpenAI + Anthropic API compatible. No Python. Includes MLX Core macOS app with chat, agent mode, and tool calling." 서버 자체는 시스템 프로그래밍 언어인 Zig로 작성되었으며, 이것이 설치해야 할 의존성이 있는 Python 애플리케이션이 아니라 하나의 작은 바이너리로 배포되는 이유입니다.

  • 핵심 기능: 모델을 한 번 로드한 뒤 동시에 세 가지 서로 다른 API 형식으로 HTTP를 통해 제공하는 로컬 추론 서버
  • 네이티브 모델 디스패치: 지원 모델 계열에는 Apple Silicon용 Apple 자체 배열 연산 프레임워크인 MLX를, GGUF 형식 모델에는 내장된 llama.cpp를 사용
  • API 호환성: OpenAI의 chat/completions 및 Responses 엔드포인트, Anthropic Messages API, Ollama API 모두 기본적으로 포트 11234에서 제공
  • 동반 앱: MLX Core는 채팅, 에이전트 워크플로우, 미디어 생성을 위한 번들형 macOS 메뉴바 애플리케이션으로, 서버와 별개의 Homebrew cask로 설치됩니다
  • 개발자: GitHub 저장소의 LICENSE 파일에 표기된 저작권 고지에 따르면 개인 개발자인 David Dalcu
  • 정식 저장소: github.com/ddalcu/mlx-serve — 원본 프로젝트입니다. 여러 포크와, 적어도 하나의 무관하고 다른 작성자가 만든 프로젝트가 유사한 이름을 공유하므로, 이 특정 저장소를 가리키고 있는지 확인하십시오

mlx-serve 릴리스 역사

mlx-serve의 GitHub 저장소는 2026년 2월에 생성되었으며, 이후 거의 매일 태그 릴리스를 발표하며 추측 디코딩, 코딩 에이전트 실행기, 확장된 미디어 생성 기능을 추가해 왔습니다. 오랜 실적을 가진 성숙한 프로젝트가 아니라 젊고 빠르게 발전하는 프로젝트입니다 — 평가 시 이 점을 고려해야 합니다.

  1. 1
    v26.8.9 — 2026년 8월 18일: 코딩 에이전트 실행기
    Why it matters: 릴리스 노트에 따르면("launch your coding agent"), 코딩 에이전트용 사전 구성 실행기를 추가했으며, 더 풍부한 채팅 및 더 빠른 디코딩과 함께 제공되었습니다. [공식 릴리스 페이지](https://github.com/ddalcu/mlx-serve/releases) 참고.
  2. 2
    v26.8.10 — 2026년 8월 26일: Neural Engine 프리필 오프로드
    Why it matters: Neural Engine 프리필 오프로드와 배치 디코딩을 추가했습니다. 이는 추론 파이프라인의 일부를 Apple 전용 Neural Engine 하드웨어로 처리하기 위한 최적화입니다.
  3. 3
    v26.8.11 — 2026년 8월 29일: MLX 0.32.2 및 Qwen 3.8 Flash Next
    Why it matters: 번들된 MLX 프레임워크 버전을 업데이트하고 더 새로운 Qwen 모델 변형에 대한 지원을 추가했습니다.
  4. 4
    v26.9.1 — 2026년 9월 3일: 100만 토큰 컨텍스트 및 더 빠른 Flash 디코딩
    Why it matters: MLX Core 동반 앱 사이드바에 터미널을 추가하고, 호환 모델에서 100만 토큰 컨텍스트 윈도우를 지원했습니다.
  5. 5
    v26.9.2 — 2026년 9월 9일: 모델별 설정 및 채팅 제공자
    Why it matters: 모델별 구성과 추가 채팅 제공자 옵션을 추가했으며, 디코딩 속도도 추가로 개선했습니다.
  6. 6
    v26.9.3 — 2026년 9월 16일: 모든 모델에 대한 추측 디코딩
    Why it matters: 릴리스 노트에 따르면, 추측 디코딩 지원을 제한된 모델 집합을 넘어 확장했으며, 64GB Mac에서의 Flash 성능 개선 작업도 함께 이루어졌습니다.
  7. 7
    v26.9.4 — 2026년 9월 17일: 정확성 수정 및 벤치마크
    Why it matters: 정확성 수정을 배포하고, 중국어 문서를 추가했으며, 새로운 벤치마크 수치를 발표했습니다 — 이 리뷰 작성 시점 기준 [공식 릴리스 페이지](https://github.com/ddalcu/mlx-serve/releases)에 기록된 가장 최근의 안정 버전 태그입니다.

mlx-serve로 무엇을 할 수 있는가?

mlx-serve의 기능 구성은 Apple Silicon에서 모델을 빠르게 제공하면서도 다른 API용으로 이미 구축된 도구와의 호환성을 유지하는 데 중점을 둡니다. 프로젝트의 GitHub README에 따라 각 부분이 실제로 하는 일은 다음과 같습니다.

  • 멀티 API 제공 — 서버는 OpenAI의 chat/completions 및 Responses 요청, Anthropic Messages API 요청, Ollama API 요청을 동일한 포트에서 동시에 처리하므로, 기존 OpenAI/Anthropic/Ollama 클라이언트 코드는 기본 URL만 변경하면 mlx-serve를 가리킬 수 있습니다
  • 네이티브 MLX 모델 디스패치 — 네이티브 MLX를 지원하는 모델(README에 따르면 Gemma, Qwen, Llama, Mistral, DeepSeek V4 Flash)은 Apple Silicon에서 Apple의 MLX 프레임워크를 직접 거쳐 실행됩니다
  • GGUF용 내장 llama.cpp — MLX가 네이티브로 지원하지 않는 수천 개의 GGUF 형식 모델은 별도 설치 없이 내장된 llama.cpp 사본을 통해 대신 실행됩니다
  • 성능 기능 — README는 Apple Silicon의 처리량을 목표로 한 네 가지 추측 디코딩 변형, 연속 배칭, KV 캐시 양자화, 맞춤형 Metal 커널을 문서화하고 있습니다
  • MLX Core 동반 앱 — PDF/이미지 첨부가 가능한 다중 세션 채팅, 내장 도구와 Model Context Protocol(MCP) 마켓플레이스 통합을 갖춘 에이전트 모드, 셸 명령을 실행하기 위한 격리된 Agent Sandbox, 재개 가능한 다운로드를 지원하는 모델 브라우저, 그리고 이미지, 동영상, 음악, 음성(Kokoro 음성을 활용한 음성 복제 포함), 3D 모델용 생성 패널을 제공하는 번들형 macOS 메뉴바 애플리케이션
  • 코딩 에이전트 실행기 — 릴리스 노트에 따르면, Claude Code, OpenCode, Pi, Cursor를 포함한 코딩 에이전트용 사전 구성된 실행 프로필
  • Python 의존성 없음 — 서버 바이너리는 약 7MB이며 다른 많은 로컬 추론 도구와 달리 Python 런타임이 필요하지 않습니다

사용 예시: mlx-serve를 사용하는 세 가지 방법

이는 위에 문서화된 mlx-serve의 명령을 기반으로 한 구체적인 워크플로우이며, 가상의 사용 사례가 아닙니다.

mlx-serve 요금: 정말 무료인가?

예 — mlx-serve에는 유료 요금제가 없습니다. GitHub 저장소에는 가격 페이지가 없으며, LICENSE 파일이 애플리케이션 전체에 적용됩니다. 라이선스 텍스트는 표준 MIT 라이선스이며 저작권자는 David Dalcu입니다 — 관대한 라이선스로 카피레프트 의무가 없습니다. GitHub 자체 저장소 메타데이터는 전체 라이선스를 단순한 MIT 배지가 아니라 사용자 지정("Other") 항목으로 분류하는데, 이는 저장소가 별도의 NOTICE 파일에 문서화된 일부 서드파티 구성 요소를 Apache License 2.0 하에 함께 번들로 포함하고 있기 때문입니다.

  • 구독도, 유료 요금제도, mlx-serve 자체가 부과하는 사용 제한도 없습니다
  • 서버나 MLX Core 동반 앱을 설치하거나 사용하는 데 계정이나 가입이 필요하지 않습니다
  • mlx-serve의 핵심 코드는 MIT 라이선스입니다 — 관대한 라이선스로, 상업적·비상업적 용도로 무료 사용 가능하며 라이선스 텍스트에 저작자 표시가 유지됩니다
  • 저장소의 NOTICE 파일에 따르면, 일부 번들 서드파티 구성 요소는 MIT가 아닌 Apache License 2.0을 따릅니다 — 조직의 컴플라이언스 검토가 정확한 라이선스 조합에 의존한다면 NOTICE 파일을 직접 읽으십시오

mlx-serve vs. Ollama

mlx-serve와 Ollama는 모두 Mac에서 HTTP API를 통해 로컬 모델을 제공하며, 동일한 클라이언트 도구 뒤에 위치할 수 있어 자주 비교됩니다. 가장 뚜렷한 차이는 플랫폼 범위와 네이티브 엔진 선택에 있습니다.

항목
mlx-serve
Ollama
플랫폼macOS(Apple Silicon)만 지원macOS, Windows, Linux
네이티브 엔진MLX(네이티브) + GGUF용 내장 llama.cppllama.cpp 기반
API 호환성OpenAI + Anthropic + Ollama API, 동일 포트자체 API, 추가로 OpenAI 호환 엔드포인트
번들 GUIMLX Core 메뉴바 앱(채팅, 에이전트 모드, 미디어 생성)최소한의 내장 GUI, 서드파티 프런트엔드에 의존
런타임 의존성단일 약 7MB 바이너리, Python 불필요단일 Go 바이너리, Python 불필요
미디어 생성MLX Core를 통한 이미지/동영상/음악/음성/3D텍스트 및 비전 채팅만 지원

프로젝트 문서에 따르면, mlx-serve의 Ollama API 호환성 덕분에 Ollama용으로 구축된 도구들이 종종 mlx-serve를 직접 가리킬 수 있습니다. macOS뿐 아니라 Windows나 Linux 등 크로스 플랫폼 지원이 중요하다면 Ollama가 더 폭넓은 지원 범위를 가진 선택지입니다. 두 프로젝트 모두 업데이트가 잦으므로 결정하기 전에 각 프로젝트 자체 사이트에서 최신 기능 세부 정보를 확인하십시오.

mlx-serve는 누구에게 적합한가?

mlx-serve가 적합한지는 Apple Silicon 하드웨어를 보유하고 있는지, 그리고 여러 클라이언트 API 형식을 지원하는 단일 서버와 미디어 생성을 위한 번들 GUI를 원하는지에 달려 있습니다.

mlx-serve vs. 다른 MLX 추론 도구

mlx-serve는 Apple의 MLX 프레임워크를 중심으로 등장한 여러 Apple Silicon 중심 추론 서버 중 하나입니다. 이 분야의 다른 옵션들과 비교했을 때 mlx-serve가 어디에 위치하는지 살펴보겠습니다 — 전체 카탈로그는 로컬 LLM 소프트웨어 디렉터리를, 가장 가까운 크로스 플랫폼 정면 비교는 위의 전용 mlx-serve vs. Ollama 비교를 참고하십시오.

  • MLX LM — MLX를 사용하여 언어 모델을 실행하고 파인튜닝하기 위한 Apple 자체 Python 라이브러리 및 명령줄 도구로, mlx-serve의 독립형 Zig 바이너리와 달리 더 저수준이며 Python 기반입니다. mlx-serve의 네이티브 디스패치가 기반으로 하는 기본 라이브러리에 대한 더 자세한 설명은 MLX LM 설명을 참고하십시오.
  • omlx — Apple Silicon 중심의 또 다른 로컬 추론 옵션입니다. 기능 구성과 API 호환성이 mlx-serve와 어떻게 비교되는지는 전용 리뷰를 참고하십시오.
  • rapid-mlx — 성능 지향적인 MLX 기반 추론 도구입니다. mlx-serve와의 처리량 및 기능 비교는 전용 리뷰를 참고하십시오.
  • LoRAX — 다중 LoRA 어댑터 서빙 프레임워크입니다. 워크플로우가 서버당 단일 모델이 아니라 하나의 기본 모델에서 여러 파인튜닝된 어댑터를 서빙해야 하는 경우 관련이 있으며, 이는 mlx-serve의 설계 초점이 아닙니다.
  • Ollama — 크로스 플랫폼 로컬 모델 서버입니다. 플랫폼 범위와 네이티브 엔진 측면에서 mlx-serve와 어떻게 다른지는 위의 전용 비교 섹션을 참고하십시오.

mlx-serve 평가 시 흔한 실수

mlx-serve에 대한 혼란은 대부분 플랫폼 제약, GitHub의 라이선스 분류, 또는 대부분의 다른 로컬 추론 서버처럼 Python 도구라고 가정하는 데서 비롯됩니다.

자주 묻는 질문

mlx-serve란 무엇입니까?

mlx-serve(github.com/ddalcu/mlx-serve)는 Zig로 작성된 무료 오픈소스 추론 서버로, Apple Silicon Mac에서 AI 모델을 로컬로 실행하며 단일 바이너리에서 OpenAI 호환, Anthropic 호환, Ollama 호환 API를 제공합니다.

mlx-serve는 무료입니까?

예. GitHub 저장소에는 가격 페이지가 없으며, LICENSE 파일은 MIT 라이선스로 핵심 애플리케이션 전체에 적용되며 유료 요금제는 없습니다.

mlx-serve는 오픈소스입니까? 어떤 라이선스를 사용합니까?

예, mlx-serve는 오픈소스입니다. 핵심 LICENSE 파일은 표준 MIT 라이선스이며 저작권자는 David Dalcu입니다. 저장소는 별도의 NOTICE 파일에 명시된 일부 서드파티 구성 요소도 Apache License 2.0 하에 번들로 포함하고 있으며, 이 때문에 GitHub 저장소 메타데이터는 라이선스를 단순한 MIT 배지가 아니라 사용자 지정("Other") 항목으로 표시합니다. 법적 판단을 위해서는 두 파일을 직접 확인하십시오.

mlx-serve는 어떤 플랫폼을 지원합니까?

공식 GitHub README에 따르면 Apple Silicon(M 시리즈) 하드웨어에서 macOS 26.2 이상만 지원합니다. Windows, Linux, Intel Mac은 지원하지 않습니다.

mlx-serve는 Python이 필요합니까?

아니요. mlx-serve는 Zig로 작성되었으며 약 7MB 크기의 단일 바이너리로 배포되고, 다른 많은 로컬 추론 도구와 달리 Python 런타임 의존성이 없습니다.

mlx-serve는 어떤 모델 형식을 지원합니까?

네이티브 MLX를 지원하는 모델(README에는 Gemma, Qwen, Llama, Mistral, DeepSeek V4 Flash가 명시되어 있음)은 Apple의 MLX 프레임워크를 직접 거쳐 실행됩니다. 다른 GGUF 형식 모델은 별도 설치 없이 내장된 llama.cpp 사본을 통해 실행됩니다.

MLX Core란 무엇입니까?

MLX Core는 mlx-serve에 번들된 macOS 메뉴바 동반 앱으로, 서버와 별개의 Homebrew cask로 설치됩니다. 다중 세션 채팅, MCP 도구 통합을 갖춘 에이전트 모드, 모델 브라우저, 이미지·동영상·음악·음성·3D 모델용 생성 패널을 제공합니다.

mlx-serve가 기존 도구에서 Ollama를 대체할 수 있습니까?

많은 경우 그렇습니다 — mlx-serve는 동일한 포트에서 OpenAI 및 Anthropic 호환 API와 함께 Ollama 호환 API도 제공하므로, Ollama API용으로 구축된 도구는 기본 URL만 변경하면 자주 mlx-serve를 가리킬 수 있습니다. 프로덕션 워크플로우에서 전환하기 전에 특정 클라이언트의 호환성을 확인하십시오.

mlx-serve는 어떻게 설치합니까?

Homebrew를 통해 설치합니다: 서버는 brew tap ddalcu/mlx-serve https://github.com/ddalcu/mlx-serve 실행 후 brew install mlx-serve를, 선택적인 메뉴바 동반 앱은 brew install --cask mlx-core를 실행합니다. 설치 전에 최신 지침은 공식 GitHub README를 확인하십시오.

mlx-serve는 언제 처음 출시되었습니까?

mlx-serve의 GitHub 저장소는 2026년 2월에 생성되었습니다. 이 리뷰 작성 시점 기준, 프로젝트는 거의 매일 태그 릴리스를 발표하고 있습니다 — 전체 역사는 공식 릴리스 페이지를 참고하십시오.

출처

← 고급 로컬 LLM으로 돌아가기