Skip to main content
PromptQuorum
/고급 로컬 LLM/oMLX 리뷰 2026: SSD 캐싱을 지원하는 Apple Silicon 추론 서버
Overview & Reference

oMLX 리뷰 2026: SSD 캐싱을 지원하는 Apple Silicon 추론 서버

·9분 읽기·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

oMLX는 Apple Silicon용 무료 오픈소스 로컬 추론 서버로(소스코드는 github.com/jundot/omlx), Apple의 MLX 프레임워크를 통해 오픈 웨이트 모델을 사용자의 Mac에서 직접 실행하며, 관리를 위한 네이티브 macOS 메뉴 바 앱과 다른 도구를 위한 OpenAI/Anthropic 호환 API 엔드포인트를 제공합니다. 수정되지 않은 표준 Apache License 2.0(저작권은 oMLX contributors)으로 라이선스되어 있으며, 유료 요금제는 없습니다. oMLX는 Apple Silicon(M1~M5)을 탑재한 macOS 15.0(Sequoia) 이상을 필요로 하며, Intel Mac, Windows, Linux에서는 실행되지 않습니다. 이는 MLX 자체가 Apple Silicon만을 대상으로 하기 때문입니다. 이 도구의 핵심 기능은 비활성 컨텍스트 블록을 폐기하지 않고 SSD로 오프로드하는 계층형 키-값 캐시로, 코딩 에이전트가 긴 대화로 다시 돌아올 때 해당 컨텍스트를 처음부터 다시 계산하는 대신 몇 초 만에 복원할 수 있게 해줍니다.

oMLX(github.com/jundot/omlx, 문서는 omlx.ai에도 게재)는 Apple의 MLX 프레임워크를 기반으로 구축된 무료 오픈소스 로컬 추론 서버로, 네이티브 macOS 메뉴 바 앱과 명령줄 서버 두 가지 형태로 배포됩니다. 오픈 웨이트 모델을 Mac에서 완전히 실행하고, OpenAI 및 Anthropic 호환 API 엔드포인트를 제공하며, 재시작 후에도 긴 코딩 에이전트 컨텍스트를 빠르게 유지하도록 설계된 계층형 RAM+SSD 키-값 캐시를 추가로 제공합니다. 이 리뷰에서는 oMLX가 실제로 수행하는 기능, 설치 방법, 단순한 mlx-lm과의 비교, 그리고 다른 로컬 추론 도구들 사이에서의 위치를 다룹니다.

핵심 요점

  • oMLX는 무료 오픈소스입니다. 공식 GitHub LICENSE는 수정되지 않은 표준 Apache License 2.0이며, 저작권은 oMLX contributors입니다
  • Apple의 MLX 프레임워크와 mlx-lmBatchGenerator를 통해 완전히 로컬에서 실행됩니다 — 클라우드 연결이 필요하지 않습니다
  • macOS 15.0(Sequoia) 이상, Apple Silicon(M1–M5), Python 3.11–3.13이 필요합니다. Intel Mac, Windows, Linux는 지원하지 않습니다
  • 네이티브 macOS 메뉴 바 앱(Electron이 아닌 Swift/SwiftUI)과 함께 omlx 명령줄 도구 및 백그라운드 서버를 제공합니다
  • 계층형 키-값 캐시 — 활성 블록은 RAM에, 비활성 블록은 safetensors 형식으로 SSD에 오프로드되며, 접두사 공유와 copy-on-write를 통해 서버 재시작 후에도 유지됩니다
  • http://localhost:8000에서 OpenAI 호환(/v1/chat/completions, /v1/completions, /v1/embeddings, /v1/rerank) 및 Anthropic 호환(/v1/messages) 엔드포인트를 제공합니다
  • 내장된 관리 대시보드에서 Claude Code, Cursor, OpenClaw, OpenCode, Codex, Hermes Agent, Copilot, Pi를 포함한 코딩 에이전트 통합에 대한 원클릭 설정을 제공합니다
  • 단독 개발자 jundot이 개발했으며, 2026년 3월 MLX GitHub 토론 스레드에서 처음으로 공개 발표되었습니다. 공식 저장소는 github.com/jundot/omlx이며, 다른 GitHub 사용자명 아래에 동일한 이름의 여러 포크가 존재하지만 이는 원본 프로젝트가 아닙니다

📍 한 문장으로

oMLX는 MLX를 통해 모델을 실행하는, Apple Silicon Mac용 무료 오픈소스 로컬 추론 서버로, 메뉴 바 앱과 CLI/서버 형태로 제공되며, 코딩 에이전트 컨텍스트를 처음부터 다시 계산하지 않고 빠르게 재로드할 수 있도록 페이지 처리된 SSD 캐시를 추가로 제공합니다.

💬 쉽게 말하면

코딩 에이전트를 다시 열 때마다 모델이 전체 대화 기록을 처음부터 다시 불러오는 대신, oMLX는 처리된 컨텍스트 버전을 Mac의 SSD에 저장하고 몇 초 만에 복원합니다. 사용자의 Mac에서 완전히 실행되며, 터미널을 건드릴 필요가 없도록 메뉴 바 아이콘을 제공하고, OpenAI 및 Anthropic과 동일한 API 형식도 지원하므로 Claude Code나 Cursor 같은 도구가 직접 연결할 수 있습니다.

📌참고: 이 리뷰는 로컬 LLM 소프트웨어 디렉터리에 있는 oMLX 항목의 심층 보완 자료입니다 — oMLX가 다른 수십 개의 로컬 AI 도구와 한눈에 어떻게 비교되는지 확인하려면 해당 페이지를 참고하십시오.

oMLX란 무엇인가?

oMLX는 Apple의 MLX 머신러닝 프레임워크를 완전한 서빙 스택으로 전환하는, Apple Silicon Mac용 로컬 추론 서버입니다 — OpenAI/Anthropic 호환 API, 다중 모델 관리자, 페이지 처리된 SSD 캐시, 그리고 이 모든 것을 제어하는 네이티브 macOS 메뉴 바 앱을 제공하며, 일상적인 사용에는 터미널이 필요하지 않습니다. 자체 GitHub 설명에서는 이를 "연속 배칭, 계층형 KV 캐싱, 네이티브 macOS 메뉴 바 관리 인터페이스를 갖춘, Apple Silicon Mac에 최적화된 LLM 추론 서버"로 소개하고 있습니다.

  • 핵심 기능: 오픈 웨이트 모델을 로드하고 로컬 HTTP API를 통해 제공하는 백그라운드 추론 서버로, 메뉴 바 앱이나 omlx CLI를 통해 관리됩니다
  • 추론 엔진: oMLX 자체 문서에 따르면 Apple의 MLX 프레임워크와 mlx-lm 라이브러리의 BatchGenerator 위에 구축되었으며, 그 위에 독자적인 연속 배칭 및 페이지 처리 캐시 레이어가 추가되어 있습니다
  • 기반: 개발자 본인의 발표에 따르면 oMLX는 원래 vllm-mlx를 출발점으로 구축되었으며, SSD 캐시 계층화, 연속 배칭, 비전-언어 모델 지원, Anthropic 호환 API, 네이티브 macOS 인터페이스에 대한 독자적인 구현이 추가되었습니다
  • 개발자: jundot(저장소에 기재된 연락처는 junkim.dot@gmail.com)이라는 독립 유지관리자입니다 — 이 리뷰에서는 oMLX 뒤에 회사나 투자 라운드가 있다는 증거를 찾지 못했습니다
  • 공식 저장소: github.com/jundot/omlx — 다른 GitHub 사용자명 아래에 동일한 이름의 여러 포크가 존재하지만(예: mkmsyk/omlx, dannysl/omlx), 이는 원본 프로젝트가 아닙니다

oMLX의 기원과 성장

oMLX는 2026년 3월 개발자 jundot이 Apple MLX 자체 GitHub 토론 게시판에 올린 게시물을 통해 처음으로 공개 발표되었습니다. 이 발표는 oMLX를 구체적이고 명확한 문제에 대한 해결책으로 제시했습니다. 길고 계속 성장하는 컨텍스트를 재사용하는 코딩 에이전트는 Apple Silicon에서 요청마다 해당 컨텍스트를 재로드하는 데 수십 초 단위의 지연을 겪을 수 있었는데, 이는 당시 MLX 기반 서버들이 일반적으로 키-값 캐시 상태를 RAM에만 유지했고 서버가 재시작되거나 컨텍스트가 만료될 때마다 이를 잃어버렸기 때문입니다. oMLX의 페이지 처리된 SSD 캐시는 이 상태를 디스크에 영속화하여, 이전에 처리된 프리픽스를 모델에서 다시 계산하는 대신 SSD에서 복원할 수 있도록 합니다. 개발자 본인의 발표에 따르면, oMLX는 출시 시점에 이미 약 110개의 GitHub 스타를 확보했으며, vllm-mlx를 출발점으로 구축된 뒤 SSD 계층화, 연속 배칭, 비전-언어 모델 지원, Anthropic 호환 API, 네이티브 macOS 인터페이스를 위한 새로운 코드가 추가되었습니다. 이 리뷰의 발행일 기준으로 oMLX의 GitHub 저장소는 약 21,859개의 스타를 보여주고 있으며, 이는 작성 시점 기준 출시된 지 겨우 6개월 된 프로젝트치고는 빠른 성장입니다.

  • 발표: 2026년 3월 4일, github.com/ml-explore/mlx/discussions/3203에서 프로젝트 개발자 본인인 jundot이 게시
  • 출발점: vllm-mlx이며, 그 위에 개발자 본인의 SSD 계층화, 연속 배칭, VLM, Anthropic API, 네이티브 UI 코드가 추가되었습니다
  • 성장: oMLX 자체 GitHub 저장소에 따르면 2026년 3월 발표 당시 약 110개의 GitHub 스타에서 이 리뷰 작성 시점 기준 약 21,859개의 스타로 증가했습니다
  • 라이선스 이력: 저장소의 LICENSE 파일에는 "oMLX contributors"에 대한 2025년 저작권 표기가 있으며, 이는 프로젝트의 2026년 3월 공개 발표보다 앞서는 것으로, 공개 출시 이전의 비공개 개발과 일치합니다

oMLX로 무엇을 할 수 있는가?

oMLX의 기능 세트는 MLX 모델 추론을 일회성 스크립트가 아닌 지속적인 다중 모델 로컬 서버로 전환하는 데 중점을 두고 있습니다. 각 부분이 실제로 수행하는 기능은 oMLX 자체의 GitHub READMEomlx.ai 문서를 기준으로 다음과 같습니다.

  • 계층형 키-값 캐시 — 활성 컨텍스트 블록은 핫 RAM 계층에 유지되며, 비활성 블록은 접두사 공유와 copy-on-write를 지원하는 safetensors 형식으로 콜드 SSD 계층으로 이동합니다. 캐시는 폐기되지 않고 서버 재시작 후에도 유지됩니다
  • 연속 배칭 — 동시 요청은 mlx-lmBatchGenerator를 통해 처리되며, 요청을 하나씩 처리하는 대신 최대 동시성을 설정할 수 있습니다
  • 다중 모델 서빙 — LLM, 비전-언어 모델(VLM), 임베딩 모델, 리랭커를 나란히 로드할 수 있으며, LRU 축출, 수동 로드/언로드, 모델 고정, 모델별로 설정 가능한 TTL을 지원합니다
  • OpenAI 및 Anthropic 호환 API — OpenAI 형식 클라이언트를 위한 /v1/chat/completions, /v1/completions, /v1/embeddings, /v1/rerank와 Anthropic 형식 클라이언트를 위한 /v1/messages를 모두 http://localhost:8000에서 제공합니다
  • 비전-언어 및 OCR 지원 — base64, URL, 파일 입력을 통한 다중 이미지 채팅, 시각적 컨텍스트를 포함한 도구 호출, 전용 OCR 모델의 자동 감지
  • 도구 호출 및 MCP — Llama, Qwen, DeepSeek, Gemma, GLM, MiniMax, Mistral 등 다양한 모델 계열에 대한 채팅 템플릿 자동 감지를 포함한 JSON 스키마 도구 호출과 Model Context Protocol(MCP) 설정
  • 네이티브 macOS 메뉴 바 앱 — 프로젝트 자체 문서에 따르면 명시적으로 Electron이 아닌 Swift/SwiftUI 앱으로, 터미널 없이 서버를 시작, 중지, 모니터링할 수 있으며, 로컬 사용 분석(모델별 합계, 시간대별 사용 히트맵)과 충돌 시 자동 재시작 기능을 제공합니다
  • 관리 대시보드 — 서버가 실행된 후 브라우저에서 접근 가능한 /admin의 웹 UI로, 모델 관리, 내장 채팅 인터페이스, 원클릭 벤치마킹, 모델 다운로더, Claude Code, Cursor, OpenClaw, OpenCode, Codex, Hermes Agent, Copilot, Pi를 포함한 코딩 에이전트 통합에 대한 원클릭 설정을 제공합니다
  • 실험적 분산 추론 — Ring 또는 Thunderbolt RDMA 네트워킹을 통해 MLX 파이프라인 랭크 간 다중 Mac 추론을 지원하며, oMLX 자체 문서에서는 이를 실험적 기능으로 표시하고 있습니다

사용 예시: oMLX를 사용하는 세 가지 방법

다음은 위에서 문서화된 oMLX 기능을 기반으로 한 구체적인 워크플로이며, 가상의 사용 사례가 아닙니다.

oMLX 요금제: 정말 무료인가?

예 — oMLX에는 유료 요금제가 없습니다. GitHub 저장소와 omlx.ai 모두 가격 페이지가 없으며, LICENSE 파일은 "oMLX contributors"에 대한 2025년 저작권 표기가 포함된 수정되지 않은 표준 Apache License 2.0으로, 애플리케이션 전체에 적용되며 특정 기능을 결제 뒤에 가두는 조항은 없습니다.

  • 구독, 유료 요금제, oMLX 자체가 부과하는 사용량 제한이 전혀 없습니다
  • 앱을 설치하거나 실행하는 데 계정이나 가입이 필요하지 않습니다
  • 애플리케이션 자체, 메뉴 바 앱, CLI, 관리 대시보드는 모두 동일한 Apache License 2.0 조건에 따릅니다
  • oMLX는 MLX를 통해 로컬 모델만 실행하므로 클라우드 제공업체에 대한 토큰당 또는 요청당 비용도 발생하지 않습니다 — 유일한 비용은 이미 보유한 전기와 하드웨어뿐입니다

oMLX vs. mlx-lm

mlx-lm은 Apple의 MLX 생태계가 모델을 실행하고 서빙하기 위해 제공하는 Python 라이브러리 및 단순한 CLI이며, oMLX는 그 위에 직접 구축되어 연속 배칭을 위해 이 라이브러리의 BatchGenerator를 사용합니다. 두 도구는 실제로 경쟁자라기보다는 서로 다른 계층에 가깝습니다: mlx-lm은 기반이고, oMLX는 그 기반 위에 구축된 완전한 서빙 제품입니다.

측면
oMLX
mlx-lm
정체성패키지화된 추론 서버: 메뉴 바 앱 + CLI + 관리 대시보드MLX 모델을 실행/서빙하기 위한 Python 라이브러리와 경량 CLI
KV 캐싱계층형 RAM+SSD 페이지 캐시, 재시작 후에도 유지자체 문서화된 서버에 따르면 메모리 내 캐시만 지원, SSD 계층화 없음
다중 모델 관리LRU 축출, 고정, 모델별 TTL, UI를 통한 로드/언로드내장 기능이 아니며 스크립트로 처리하거나 수동으로 관리
API 호환성OpenAI 호환 및 Anthropic 호환 엔드포인트OpenAI 호환 서버 모드(mlx_lm.server)
인터페이스네이티브 macOS 메뉴 바 앱과 웹 관리 대시보드명령줄만 지원, GUI 없음
코딩 에이전트 통합Claude Code, Cursor, OpenClaw 등에 대한 원클릭 설정문서화된 기능 없음. 엔드포인트를 수동으로 설정해야 함

스크립트나 간단한 서버 명령으로 단일 MLX 모델을 실행하는 가장 단순한 방법을 원한다면, mlx-lm 하나만으로 충분할 수 있습니다. 메뉴 바 UI를 갖춘 지속적인 다중 모델 서버, 긴 에이전트 컨텍스트를 위한 SSD 기반 캐시, 원클릭 코딩 에이전트 통합을 원한다면, oMLX는 mlx-lm을 대체하는 것이 아니라 그 위에 이 레이어를 추가하기 위해 특별히 설계되었습니다.

oMLX는 누구에게 적합한가?

oMLX가 자신에게 적합한지 여부는 거의 전적으로 한 가지에 먼저 달려 있습니다: 애초에 Apple Silicon Mac을 사용하고 있는지 여부이며, 이 요구 사항에는 우회 방법이 없습니다.

oMLX vs. 다른 로컬 추론 도구

oMLX는 로컬 추론 생태계 중에서도 Apple Silicon/MLX 영역에 속해 있습니다. 이 영역의 다른 도구들과의 비교는 다음과 같습니다 — 전체 카탈로그는 로컬 LLM 소프트웨어 디렉터리를, 가장 직접적인 비교는 위의 전용 oMLX vs. mlx-lm 비교를 참고하십시오.

  • mlx-lm — oMLX 자체가 그 위에 구축된 기반 Python 라이브러리 및 CLI입니다. 완전한 서버 레이어 없이 단일 MLX 모델을 실행하는 가장 단순한 방법을 원한다면 올바른 선택입니다. 위의 전용 비교 섹션을 참고하십시오.
  • exo — 여러 Apple Silicon Mac(및 기타 기기)을 클러스터로 묶어 단일 기기로는 수용할 수 없는 더 큰 모델을 실행할 수 있게 해주는 오픈소스 도구입니다. oMLX의 실험적인 단일 클러스터 분산 모드가 사용자의 환경에 충분하지 않다면 관련이 있습니다. exo 리뷰를 참고하십시오.
  • LM Studio — Apple Silicon에서 llama.cpp와 함께 MLX도 추론 엔진 중 하나로 사용하는 크로스 플랫폼(macOS, Windows, Linux) 데스크톱 앱입니다. 동일한 도구가 Mac이 아닌 하드웨어에서도 작동해야 한다면 더 적합합니다. LM Studio 리뷰를 참고하십시오.
  • llamafile — MLX가 아닌 llama.cpp를 기반으로 한 단일 실행 파일 방식의 로컬 추론 방법으로, macOS, Windows, Linux에서 설치 과정 없이 동일한 파일을 실행할 수 있습니다. Apple Silicon 전용 성능보다 크로스 플랫폼 이식성이 더 중요하다면 유용한 대조군입니다. llamafile 설명 문서를 참고하십시오.

oMLX 평가 시 흔한 실수

oMLX를 둘러싼 대부분의 혼란은 이것이 크로스 플랫폼 도구처럼 작동한다고 가정하거나, 동일한 이름의 포크와 혼동하거나, Intel Mac 지원을 기대하는 데서 비롯됩니다.

자주 묻는 질문

oMLX란 무엇입니까?

oMLX(github.com/jundot/omlx)는 Apple Silicon Mac용 무료 오픈소스 로컬 추론 서버입니다. Apple의 MLX 프레임워크를 통해 모델을 실행하며, 네이티브 macOS 메뉴 바 앱과 omlx 명령줄 도구 및 백그라운드 서버 형태로 제공되고, OpenAI 및 Anthropic 호환 API 엔드포인트를 갖추고 있습니다.

oMLX는 무료입니까?

예. GitHub 저장소와 omlx.ai 모두 가격 페이지가 없으며, LICENSE 파일은 유료 요금제가 전혀 없는 수정되지 않은 표준 Apache License 2.0입니다.

oMLX는 Windows나 Linux에서 실행됩니까?

아니요. oMLX는 macOS 전용이며, 구체적으로 Apple Silicon(M1~M5)과 macOS 15.0(Sequoia) 이상을 필요로 합니다. 이는 Windows, Linux, Intel Mac을 대상으로 하지 않는 Apple의 MLX 프레임워크에 의존하기 때문입니다.

oMLX는 Intel Mac에서 실행됩니까?

아니요. oMLX의 문서화된 시스템 요구 사항은 Apple Silicon만을 명시하고 있습니다. oMLX가 구축된 프레임워크인 MLX는 Intel 기반 Mac을 지원하지 않습니다.

oMLX는 mlx-lm과 어떻게 다릅니까?

mlx-lm은 Apple의 MLX 생태계가 모델 실행을 위해 제공하는 기반 Python 라이브러리 및 경량 CLI입니다. oMLX는 mlx-lm의 BatchGenerator 위에 구축되어 지속적인 서버, 메뉴 바 앱, 계층형 SSD 기반 캐시, 다중 모델 관리, OpenAI/Anthropic 호환 엔드포인트를 추가로 제공합니다. 위의 전체 비교를 참고하십시오.

oMLX의 페이지 처리된 SSD 캐시는 무엇을 위한 것입니까?

비활성 키-값 캐시 블록을 RAM에서 폐기하는 대신 safetensors 형식으로 Mac의 SSD로 오프로드합니다. 장시간 실행되는 코딩 에이전트가 대규모 컨텍스트를 다시 방문할 때, oMLX는 모델에서 다시 계산하는 대신 이전에 처리된 블록을 SSD에서 복원할 수 있으며, 자체 문서에 따르면 이를 통해 긴 컨텍스트의 재로드 대기 시간을 수십 초에서 단 몇 초로 줄일 수 있습니다.

oMLX를 Claude Code나 Cursor와 함께 사용할 수 있습니까?

예. oMLX의 관리 대시보드에는 Claude Code, Cursor, OpenClaw, OpenCode, Codex, Hermes Agent, Copilot, Pi에 대한 원클릭 통합 설정이 포함되어 있으며, 해당 API는 이러한 도구들이 사용하는 OpenAI 및 Anthropic 요청 형식 모두와 호환됩니다.

oMLX는 오픈소스입니까? 어떤 라이선스를 사용합니까?

예. oMLX의 LICENSE 파일은 "oMLX contributors"에 대한 2025년 저작권 표기가 포함된 수정되지 않은 표준 Apache License 2.0입니다.

oMLX는 누가 개발합니까?

oMLX는 독립 유지관리자인 jundot이 개발합니다(저장소에 기재된 연락처는 junkim.dot@gmail.com). 이 리뷰에서는 해당 프로젝트 뒤에 회사나 투자 라운드가 있다는 증거를 찾지 못했습니다.

github.com/jundot/omlx가 진짜 oMLX 저장소입니까?

예. 다른 GitHub 사용자명 아래에 "omlx"라는 동일한 이름의 저장소가 여러 개 존재하지만, github.com/jundot/omlx가 원본 프로젝트이며, 이는 Apple MLX의 GitHub 토론 게시판에서의 개발자 본인의 발표로 확인되었습니다.

출처

← 고급 로컬 LLM으로 돌아가기