Skip to main content
PromptQuorum
ホーム/ローカルLLM活用/oMLXレビュー2026:SSDキャッシュ搭載のApple Silicon推論サーバー
Overview & Reference

oMLXレビュー2026:SSDキャッシュ搭載のApple Silicon推論サーバー

·10分で読める·Hans Kuepper 著 · PromptQuorumの創設者、マルチモデルAIディスパッチツール · PromptQuorum

oMLXは、Apple Silicon向けの無料・オープンソースのローカル推論サーバーです(ソースコードはgithub.com/jundot/omlx)。AppleのMLXフレームワークを通じてオープンウェイトモデルをご自身のMac上で実行し、管理用のネイティブmacOSメニューバーアプリと、他のツール向けのOpenAI/Anthropic互換APIエンドポイントを備えています。ライセンスは無修正のApache License 2.0(著作権表示はoMLX contributors)で、有料プランはありません。oMLXはApple Silicon(M1〜M5)搭載のmacOS 15.0(Sequoia)以降を必要とし、Intel Mac、Windows、Linuxでは動作しません。これはMLX自体がApple Siliconのみを対象としているためです。目玉機能は、非アクティブなコンテキストブロックを破棄せずにSSDへオフロードする階層型キーバリューキャッシュで、コーディングエージェントが長い会話に戻ってきた際、ゼロから再計算するのではなく数秒でそのコンテキストを復元できます。

oMLX(github.com/jundot/omlx、詳細はomlx.aiにも記載)は、AppleのMLXフレームワーク上に構築された無料・オープンソースのローカル推論サーバーで、ネイティブのmacOSメニューバーアプリとコマンドラインサーバーの両方として配布されています。オープンウェイトモデルをMac上で完全に実行し、OpenAI互換・Anthropic互換のAPIエンドポイントを公開し、長いコーディングエージェントのコンテキストを再起動後も高速に保つための階層型RAM+SSDキーバリューキャッシュを搭載しています。このレビューでは、oMLXが実際に何をするか、インストール方法、シンプルなmlx-lmとの比較、他のローカル推論ツールとの位置づけを解説します。

重要なポイント

  • oMLXは無料・オープンソースです。公式GitHub LICENSEは無修正のApache License 2.0で、著作権表示はoMLX contributorsです
  • Apple の MLX フレームワークと mlx-lmBatchGenerator を通じて完全にローカルで動作します — クラウド接続は不要です
  • macOS 15.0(Sequoia)以降Apple Silicon(M1〜M5)Python 3.11〜3.13が必要です。Intel Mac、Windows、Linuxはサポートしません
  • ネイティブのmacOSメニューバーアプリ(Swift/SwiftUI、Electronではない)に加え、omlxコマンドラインツールとバックグラウンドサーバーを提供します
  • 階層型キーバリューキャッシュ — ホットなブロックはRAMに、コールドなブロックはsafetensors形式でSSDにオフロードされ、プレフィックス共有とcopy-on-writeを備えてサーバー再起動後も持続します
  • OpenAI互換(/v1/chat/completions/v1/completions/v1/embeddings/v1/rerank)とAnthropic互換(/v1/messages)のエンドポイントをhttp://localhost:8000で公開します
  • 組み込みの管理ダッシュボードから、Claude Code、Cursor、OpenClaw、OpenCode、Codex、Hermes Agent、Copilot、Piを含むコーディングエージェント連携のワンクリックセットアップが可能です
  • 単独の開発者jundotによって開発され、MLXのGitHubディスカッションスレッドで2026年3月に初めて公に発表されました。正式なリポジトリはgithub.com/jundot/omlxで、他のGitHubユーザー名の下に同名のフォークが複数存在しますが、それらはオリジナルのプロジェクトではありません

📍 一文で説明

oMLXは、MLXを通じてモデルを実行する、Apple Silicon Mac向けの無料・オープンソースのローカル推論サーバーで、メニューバーアプリとCLI/サーバーとして提供され、コーディングエージェントのコンテキストをゼロから再計算せず素早く再読み込みできるページ化SSDキャッシュを備えています。

💬 簡潔に説明

コーディングエージェントを再度開くたびにモデルが会話履歴全体をゼロから読み込む代わりに、oMLXはその処理済みコンテキストをMacのSSDに保存し、数秒で復元します。すべてご自身のMac上で完結し、ターミナルを操作せずに済むメニューバーアイコンがあり、OpenAIやAnthropicと同じAPI形式にも対応しているため、Claude CodeやCursorのようなツールから直接接続できます。

📌補足: このレビューは、ローカルLLMソフトウェアディレクトリ内のoMLXのエントリーに付随する詳細版です。oMLXが他の数十種類のローカルAIツールと比べてどうかを一目で確認するには、そのページをご覧ください。

oMLXとは?

oMLXは、AppleのMLX機械学習フレームワークを完全なサービングスタックに変える、Apple Silicon Mac向けのローカル推論サーバーです — OpenAI/Anthropic互換のAPI、マルチモデルマネージャー、ページ化SSDキャッシュ、そしてすべてを制御するネイティブmacOSメニューバーアプリが揃っており、日常的な利用にターミナルを必要としません。自身のGitHubの説明では、「継続的バッチ処理、階層型KVキャッシュ、ネイティブmacOSメニューバー管理インターフェースを特徴とする、Apple Silicon Mac向けに最適化されたLLM推論サーバー」と位置づけられています。

  • 中核機能:オープンウェイトモデルを読み込み、ローカルHTTP API経由で提供するバックグラウンド推論サーバーで、メニューバーアプリまたはomlx CLIから管理します
  • 推論エンジン:oMLX自身のドキュメントによると、AppleのMLXフレームワークとmlx-lmライブラリのBatchGenerator上に構築され、その上に独自の継続的バッチ処理とページ化キャッシュ層を追加しています
  • 基盤:開発者自身の発表によると、oMLXはもともとvllm-mlxを出発点として構築され、SSDキャッシュの階層化、継続的バッチ処理、ビジョン言語モデル対応、Anthropic互換API、ネイティブmacOSインターフェースが独自に実装されて追加されました
  • 開発者:jundot(リポジトリに記載の連絡先はjunkim.dot@gmail.com)で、独立系メンテナーです — このレビューでは、oMLXの背後に企業や資金調達ラウンドがある証拠は見つかりませんでした
  • 正式なリポジトリ:github.com/jundot/omlx — 他のGitHubユーザー名の下に同一名称のフォークが複数存在します(例:mkmsyk/omlx、dannysl/omlx)が、それらはオリジナルのプロジェクトではありません

oMLXの誕生と成長

oMLXは、開発者jundotによって2026年3月、Apple MLX自身のGitHubディスカッションボードへの投稿で初めて公に発表されました。この発表は、oMLXを具体的な問題への解決策として位置づけています。長く成長し続けるコンテキストを再利用するコーディングエージェントは、Apple Silicon上でリクエストのたびにそのコンテキストの再読み込みに数十秒単位の遅延が生じることがありました。これは、当時のMLXベースのサーバーが一般にキーバリューキャッシュの状態をRAMにのみ保持し、サーバーの再起動やコンテキストの期限切れのたびに失っていたためです。oMLXのページ化SSDキャッシュは代わりにその状態をディスクに永続化するため、以前処理済みのプレフィックスをモデルから再計算する代わりにSSDから復元できます。開発者自身の発表によると、oMLXはローンチ時点ですでに約110のGitHubスターを獲得しており、vllm-mlxを出発点として、SSD階層化、継続的バッチ処理、ビジョン言語モデル対応、Anthropic互換API、ネイティブmacOSインターフェースの新規コードが加えられていました。このレビューの公開日時点で、oMLXのGitHubリポジトリは約21,859スターを示しており、執筆時点でわずか半年のプロジェクトとしては急速な成長です。

  • 発表:2026年3月4日、github.com/ml-explore/mlx/discussions/3203にて、プロジェクトの開発者本人であるjundotが投稿
  • 出発点:vllm-mlx。開発者独自のSSD階層化、継続的バッチ処理、VLM、Anthropic API、ネイティブUIのコードがその上に追加されています
  • 成長:2026年3月の発表時点の約110GitHubスターから、このレビュー時点の約21,859スターまで、oMLX自身のGitHubリポジトリによると成長
  • ライセンスの経緯:リポジトリのLICENSEファイルには「oMLX contributors」に対する2025年の著作権表示があり、これはプロジェクトの2026年3月の公式発表より前のもので、公開ローンチ前に非公開で開発されていたことと整合します

oMLXでできること

oMLXの機能セットは、MLXモデル推論を単発のスクリプトではなく、永続的なマルチモデルのローカルサーバーに変えることを中心としています。各機能が実際に何をするかを、oMLX自身のGitHub READMEomlx.aiのドキュメントに基づいて紹介します。

  • 階層型キーバリューキャッシュ — アクティブなコンテキストブロックはホットなRAM層に保持され、非アクティブなブロックはsafetensors形式のコールドなSSD層に移動します。プレフィックス共有とcopy-on-writeを備え、破棄されずにサーバー再起動後も残ります
  • 継続的バッチ処理 — 同時リクエストはmlx-lmBatchGeneratorを通じて処理され、最大同時実行数を設定でき、リクエストを1件ずつ処理するのではありません
  • マルチモデル提供 — LLM、ビジョン言語モデル(VLM)、埋め込みモデル、リランカーを並行して読み込め、LRU退避、手動での読み込み/解放、モデルのピン留め、モデルごとに設定可能なTTLに対応します
  • OpenAI互換・Anthropic互換API — OpenAI形式のクライアント向けに/v1/chat/completions/v1/completions/v1/embeddings/v1/rerank、Anthropic形式のクライアント向けに/v1/messagesを、すべてhttp://localhost:8000から提供します
  • ビジョン言語およびOCR対応 — base64、URL、ファイル入力によるマルチ画像チャット、視覚コンテキストを伴うツール呼び出し、専用OCRモデルの自動検出
  • ツール呼び出しとMCP — Llama、Qwen、DeepSeek、Gemma、GLM、MiniMax、Mistralなど各モデルファミリーのチャットテンプレートを自動検出するJSONスキーマのツール呼び出し、およびModel Context Protocol(MCP)設定
  • ネイティブmacOSメニューバーアプリ — プロジェクト自身のドキュメントによれば明示的にElectronではないSwift/SwiftUI製アプリで、ターミナルなしでサーバーの起動・停止・監視ができ、ローカルの利用状況分析(モデル別合計、時間帯別利用ヒートマップ)やクラッシュ時の自動再起動を備えています
  • 管理ダッシュボード — サーバー稼働後にブラウザからアクセスできる/adminのWeb UIで、モデル管理、組み込みのチャットインターフェース、ワンクリックベンチマーク、モデルダウンローダー、Claude Code、Cursor、OpenClaw、OpenCode、Codex、Hermes Agent、Copilot、Piを含むコーディングエージェント連携のワンクリックセットアップができます
  • 実験的な分散推論 — RingまたはThunderbolt RDMAネットワーク経由でMLXパイプラインランクをまたいだマルチMac推論で、oMLX自身のドキュメントで実験的と位置づけられています

使用例:oMLXの3つの使い方

これらは、上記でドキュメント化されたoMLXの機能から構成される具体的なワークフローであり、仮想的な使用例ではありません。

oMLXの料金:本当に無料?

はい — oMLXに有料プランはありません。GitHubリポジトリにもomlx.aiにも料金ページはなく、LICENSEファイルは「oMLX contributors」の2025年の著作権表示が入った無修正のApache License 2.0で、アプリケーション全体に適用され、特定の機能を支払いの条件とする条項はありません。

  • サブスクリプション、有料プラン、oMLX自体による利用制限は一切ありません
  • インストールや利用にアカウントや登録は不要です
  • アプリケーション本体、メニューバーアプリ、CLI、管理ダッシュボードはすべて同じApache License 2.0の条件でカバーされています
  • oMLXはMLXを通じてローカルモデルのみを実行するため、クラウドプロバイダーへのトークン単位・リクエスト単位のコストも発生しません — 唯一のコストは、すでにお持ちの電気代とハードウェアです

oMLX vs. mlx-lm

mlx-lmは、AppleのMLXエコシステムがモデルの実行・提供のために用意しているPythonライブラリとシンプルなCLIで、oMLXはその上に直接構築され、継続的バッチ処理にBatchGeneratorを利用しています。両者は実質的に競合というより異なるレイヤーです。mlx-lmが基盤であり、oMLXはその基盤の上に構築された完全なサービング製品です。

観点
oMLX
mlx-lm
位置づけパッケージ化された推論サーバー:メニューバーアプリ+CLI+管理ダッシュボードMLXモデルの実行・提供向けのPythonライブラリと軽量CLI
KVキャッシュ階層型RAM+SSDページ化キャッシュ、再起動後も持続自身のドキュメント化されたサーバーによればメモリ内キャッシュのみで、SSD階層化なし
マルチモデル管理LRU退避、ピン留め、モデルごとのTTL、UIからの読み込み/解放組み込み機能ではなく、スクリプトまたは手動管理
API互換性OpenAI互換・Anthropic互換エンドポイントOpenAI互換のサーバーモード(mlx_lm.server
インターフェースネイティブmacOSメニューバーアプリとWeb管理ダッシュボードコマンドラインのみでGUIなし
コーディングエージェント連携Claude Code、Cursor、OpenClaw等のワンクリックセットアップドキュメント化された機能はなく、手動でのエンドポイント設定が必要

スクリプトやシンプルなサーバーコマンドから1つのMLXモデルを実行する最もシンプルな方法を求めるなら、mlx-lm単体で十分かもしれません。メニューバーUIを備えた永続的なマルチモデルサーバー、長いエージェントコンテキスト向けのSSD対応キャッシュ、ワンクリックのコーディングエージェント連携が欲しいなら、oMLXはmlx-lmを置き換えるのではなく、その上にこの層を追加するために特化して作られています。

oMLXはどんな人におすすめ?

oMLXが合うかどうかは、ほぼすべてまず1つの条件にかかっています。それは、そもそもApple Silicon Macを使っているかどうかで、この要件には回避策がありません。

oMLX vs. 他のローカル推論ツール

oMLXは、ローカル推論の分野の中でもApple Silicon/MLXの領域に位置しています。同じ領域の他のツールとの比較は以下の通りです — 全体のカタログはローカルLLMソフトウェアディレクトリを、最も直接的な比較は上記のoMLX vs. mlx-lm比較をご覧ください。

  • mlx-lm — oMLX自体がその上に構築されている、基盤となるPythonライブラリとCLIです。完全なサーバー層なしで1つのMLXモデルを実行する最もシンプルな方法が欲しいなら適切な選択です。上記の比較セクションをご覧ください。
  • exo — 複数のApple Silicon Mac(および他のデバイス)をクラスタ化して、単一のマシンでは収まらない大きなモデルを実行するためのオープンソースツールです。oMLXの実験的な単一クラスタ分散モードでは足りない場合に関連します。exoレビューをご覧ください。
  • LM Studio — Apple Silicon上でllama.cppと並んでMLXも推論エンジンの1つとして使用する、クロスプラットフォーム(macOS、Windows、Linux)のデスクトップアプリです。同じツールをMac以外のハードウェアでも動かす必要がある場合により適しています。LM Studioレビューをご覧ください。
  • llamafile — MLXではなくllama.cpp上に構築された、単一実行ファイルによるローカル推論のアプローチで、macOS、Windows、Linuxで同じファイルをインストール不要で実行できます。Apple Silicon特有の性能よりクロスプラットフォームの携帯性が重要な場合に有用な対比になります。llamafile解説の記事をご覧ください。

oMLX評価時のよくある間違い

oMLXをめぐる混乱の多くは、クロスプラットフォームツールのように動作すると思い込んだり、同名のフォークと混同したり、Intel Macサポートを期待したりすることから生じます。

よくある質問

oMLXとは何ですか?

oMLX(github.com/jundot/omlx)は、Apple Silicon Mac向けの無料・オープンソースのローカル推論サーバーです。AppleのMLXフレームワークを通じてモデルを実行し、ネイティブのmacOSメニューバーアプリに加え、omlxコマンドラインツールとバックグラウンドサーバーとして提供され、OpenAI互換・Anthropic互換のAPIエンドポイントを備えています。

oMLXは無料ですか?

はい。GitHubリポジトリにもomlx.aiにも料金ページはなく、LICENSEファイルはいかなる有料プランもない無修正のApache License 2.0です。

oMLXはWindowsやLinuxで動きますか?

いいえ。oMLXはmacOS専用で、特にApple Silicon(M1〜M5)とmacOS 15.0(Sequoia)以降を必要とします。これはAppleのMLXフレームワークに依存しており、Windows、Linux、Intel Macを対象としていないためです。

oMLXはIntel Macで動きますか?

いいえ。oMLXのドキュメント化されたシステム要件はApple Siliconのみを指定しています。oMLXが構築されている基盤であるMLXは、Intelベースのmacをサポートしていません。

oMLXはmlx-lmとどう違いますか?

mlx-lmは、AppleのMLXエコシステムがモデル実行のために提供する基盤のPythonライブラリと軽量CLIです。oMLXはmlx-lmのBatchGeneratorの上に構築され、永続的なサーバー、メニューバーアプリ、階層型のSSD対応キャッシュ、マルチモデル管理、OpenAI/Anthropic互換エンドポイントを追加しています。詳細は上記の完全な比較をご覧ください。

oMLXのページ化SSDキャッシュは何のためにありますか?

非アクティブなキーバリューキャッシュブロックをRAMから破棄せず、safetensors形式でMacのSSDにオフロードします。長時間稼働するコーディングエージェントが大きなコンテキストに再度アクセスする際、oMLXはモデルから再計算する代わりにSSDから以前処理済みのブロックを復元でき、その独自のドキュメントによれば、長いコンテキストの再読み込み待ち時間を数十秒から数秒へと短縮できるとされています。

oMLXをClaude CodeやCursorと一緒に使えますか?

はい。oMLXの管理ダッシュボードには、Claude Code、Cursor、OpenClaw、OpenCode、Codex、Hermes Agent、Copilot、Piのワンクリック連携設定が含まれており、そのAPIはこれらのツールが使用するOpenAI形式とAnthropic形式の両方のリクエストに対応しています。

oMLXはオープンソースですか?どのライセンスを使用していますか?

はい。oMLXのLICENSEファイルは、「oMLX contributors」の2025年の著作権表示が入った無修正のApache License 2.0です。

oMLXは誰が開発していますか?

oMLXは、独立系メンテナーのjundotによって開発されています(リポジトリに記載の連絡先はjunkim.dot@gmail.com)。このレビューでは、このプロジェクトの背後に企業や資金調達ラウンドがある証拠は見つかりませんでした。

github.com/jundot/omlxは本物のoMLXリポジトリですか?

はい。「omlx」という同一名称のリポジトリが他のGitHubユーザー名の下に複数存在しますが、github.com/jundot/omlxが、Apple MLXのGitHubディスカッションボードでの開発者自身の発表によって確認されたオリジナルのプロジェクトです。

情報源

← ローカルLLM活用 に戻る