重要なポイント
- 46ツール、3種類:推論エンジン(30)、ランタイム・マネージャー(13)、ルーター・ゲートウェイ(4)。Ollamaはエンジンでもありランタイムでもあるため、2つのグループに登場します。
- 表は各ツールのレコードから生成され、公式のREADMEまたはサイトと照合しています。ダッシュは「ドキュメントに記載なし」の意味であり、「非対応」ではありません。よく知られた一部のツールでは、ここで参照したドキュメントが特定の機能に触れていないため、該当セルはダッシュになっています。
- 表の各ツール名は、そのツール専用のPromptQuorumレビューにリンクしています。インストール手順や制約はそちらで扱っています。
📍 一文で説明
モデルをローカルで動かすには、推論エンジン、ランタイム・マネージャー、ルーター・ゲートウェイの3種類のツールが関わるため、PromptQuorumディレクトリの46ツールは種類ごとに比較しています。比較表は、各ツールのレビューと同じツールデータから生成されています。
💬 簡潔に説明
エンジンは実際にモデルを動かす部分、ランタイムやマネージャーはモデルのダウンロードと実行を代行するもの、ゲートウェイはそれらの間でリクエストを振り分けるものです。エンジンとゲートウェイをGPU対応で比べても意味がないため、本ガイドでは同じ種類同士を比較します。
比較の方法
各ツールの情報(価格、ライセンス、対応プラットフォーム、ハードウェア要件、カテゴリ固有の属性)は、そのツールのディレクトリレコードに一度だけ保存されています。下の比較表はそのレコードから生成され、ツール個別のレビューも同じレコードを参照するため、両者が異なる値を示すことはありません。
カテゴリ固有の属性(たとえばOpenAI互換APIやAMD GPU対応)は、各プロジェクトの公式READMEまたはウェブサイトから取得し、そこに書かれた文言と照合しました。ドキュメントに記載がない場合は、推測せずに表にダッシュを表示します。記述に条件が付く場合(実験的、計画中、別プロジェクト経由でのみ利用可能など)は、その属性を表から外し、ツールのレビューで扱います。
表に載っているのは、PromptQuorumに専用レビューがあるツールのみです。APIサーバーとしてのみ掲載しているツール(h2oGPT、Tabby、OpenAI Edge TTS)は、それぞれのカテゴリで比較しています。この比較は自分のハードウェアで動くツールを一覧にしたもので、順位付けはしていません。適切なツールは条件によって変わるためです。
比較表
以下でツールの種類を選び、行を横に読み進めてください。ツール名をクリックすると、PromptQuorumの詳しいレビューが開きます。
| ツール | 価格 | ライセンス | プラットフォーム | 動作環境 | ハードウェア | バージョン | OpenAI互換API | NVIDIA GPU | Apple Silicon | AMD GPU | CPU推論 | マルチGPU/マルチノード | レビュー | 製品リンク · 開示済み |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| candle-vllm | 無料 | MIT | macOS, Windows, Linux | ローカル | モデルにより異なる | v0.9.1 | はい | はい | はい | — | — | はい | レビューを読む → | candle-vllm |
| claude-code-local | 無料 | MIT | macOS | ローカル | モデルにより異なる | v0.3.0 | — | — | はい | — | — | — | レビューを読む → | claude-code-local |
| ExLlamaV2 | 無料 | MIT | Windows, Linux | ローカル | VRAM 8 GB | v0.3.2 | — | はい | — | — | — | はい | レビューを読む → | ExLlamaV2 |
| exo | 無料 | Apache-2.0 | macOS, Linux | ローカル | モデルにより異なる | — | はい | — | はい | — | はい | はい | レビューを読む → | exo |
| KoboldCpp | 無料 | AGPL-3.0 | Windows, Linux, macOS | ローカル | モデルにより異なる | v1.121 | はい | はい | はい | はい | はい | — | レビューを読む → | KoboldCpp |
| KServe | 無料 | Apache-2.0 | Linux | ローカル | CPUで十分 | v0.20.0 | はい | — | — | — | — | はい | レビューを読む → | KServe |
| llama.cpp | 無料 | MIT | macOS, Windows, Linux | ローカル | モデルにより異なる | v0.4.1 | はい | はい | はい | はい | はい | — | レビューを読む → | llama.cpp |
| Llamafile | 無料 | Apache-2.0 | macOS, Windows, Linux | ローカル | モデルにより異なる | 0.10.6 | — | — | — | — | — | — | レビューを読む → | Llamafile |
| LMDeploy | 無料 | Apache-2.0 | Linux | ローカル | モデルにより異なる | v0.17.0 | — | はい | — | — | — | はい | レビューを読む → | LMDeploy |
| LocalAI | 無料 | MIT | macOS, Windows, Linux | ローカル | モデルにより異なる | — | はい | はい | はい | はい | はい | はい | レビューを読む → | LocalAI |
| LoRAX | 無料 | Apache-2.0 | Linux | ローカル | モデルにより異なる | v0.12.1 | はい | はい | — | — | — | はい | レビューを読む → | LoRAX |
| Lucebox | 無料 | Apache-2.0 | Linux | ローカル | モデルにより異なる | — | はい | はい | — | はい | — | はい | レビューを読む → | Lucebox |
| MLC LLM | 無料 | Apache-2.0 | macOS, Windows, Linux, iOS, Android | ローカル | モデルにより異なる | — | はい | はい | はい | はい | — | — | レビューを読む → | MLC LLM |
| MLX-LM | 無料 | MIT | macOS | ローカル | モデルにより異なる | — | — | — | はい | — | — | はい | レビューを読む → | MLX-LM |
| mlx-serve | 無料 | MIT | macOS | ローカル | モデルにより異なる | v26.9.4 | はい | — | はい | — | — | — | レビューを読む → | mlx-serve |
| mlxcel | 無料 | Apache-2.0 | macOS, Linux | ローカル | モデルにより異なる | v0.7.0 | はい | はい | はい | — | — | はい | レビューを読む → | mlxcel |
| NVIDIA Dynamo | 無料 | Apache-2.0 | Linux | ローカル | モデルにより異なる | v1.4–v1.6 | はい | — | — | — | — | はい | レビューを読む → | NVIDIA Dynamo |
| Ollama | 無料 | MIT | macOS, Windows, Linux | ローカル | モデルにより異なる | — | — | — | — | — | — | — | レビューを読む → | Ollama |
| OlliteRT | 無料 | Apache-2.0 | Android | ローカル | CPUで十分 | — | はい | — | — | — | はい | — | レビューを読む → | OlliteRT |
| oMLX | 無料 | Apache-2.0 | macOS | ローカル | モデルにより異なる | v0.6.4 | はい | — | はい | — | — | はい | レビューを読む → | oMLX |
| OpenLLM | 無料 | Apache-2.0 | — | ハイブリッド | モデルにより異なる | — | はい | — | — | — | — | — | レビューを読む → | OpenLLM |
| Rapid-MLX | 無料 | Apache-2.0 | macOS | ローカル | RAM 8 GB | — | はい | — | はい | — | — | — | レビューを読む → | Rapid-MLX |
| SGLang | 無料 | Apache-2.0 | Linux | ローカル | モデルにより異なる | — | — | はい | — | はい | はい | はい | レビューを読む → | SGLang |
| Shimmy | 無料 | Apache-2.0 | macOS, Windows, Linux | ローカル | モデルにより異なる | — | はい | はい | はい | はい | — | — | レビューを読む → | Shimmy |
| SwiftLM | 無料 | MIT | macOS, iOS | ローカル | モデルにより異なる | — | はい | — | はい | — | — | — | レビューを読む → | SwiftLM |
| TensorRT-LLM | 無料 | Apache-2.0 | Windows, Linux | ローカル | モデルにより異なる | — | — | はい | — | — | — | — | レビューを読む → | TensorRT-LLM |
| text-generation-webui | 無料 | AGPL-3.0 | Windows, Linux, macOS | ローカル | モデルにより異なる | — | はい | はい | はい | はい | はい | — | レビューを読む → | text-generation-webui |
| TurboFieldfare | 無料 | Apache-2.0 | macOS | ローカル | RAM 2 GB | — | — | — | はい | — | — | — | レビューを読む → | TurboFieldfare |
| vLLM | 無料 | Apache-2.0 | Linux | ローカル | モデルにより異なる | — | はい | はい | — | はい | はい | はい | レビューを読む → | vLLM |
| vllm-mlx | 無料 | Apache-2.0 | macOS | ローカル | モデルにより異なる | — | はい | — | はい | — | — | — | レビューを読む → | vllm-mlx |
「—」は、そのプロジェクト自身のドキュメントに記載がないことを示すもので、機能がないという意味ではありません。値は各プロジェクトの公式READMEまたはサイトから取得し、ツールのレビューを更新する際に再確認しています。
推論エンジン:違いはどこにあるか
- OpenAI互換API。 candle-vllm、NVIDIA Dynamo、exo、KoboldCpp、KServe、llama.cpp、LocalAI、LoRAX、Lucebox、MLC LLM、mlx-serve、mlxcel、OlliteRT、oMLX、OpenLLM、Rapid-MLX、Shimmy、SwiftLM、text-generation-webui、vllm-mlx、vLLMは、OpenAI互換のHTTP APIを文書化しています。そのため、OpenAI API向けに書かれたアプリをこれらに向けることができます。
- NVIDIA GPU。 candle-vllm、ExLlamaV2、KoboldCpp、llama.cpp、LMDeploy、LocalAI、LoRAX、Lucebox、MLC LLM、mlxcel、SGLang、Shimmy、TensorRT-LLM、text-generation-webui、vLLMは、NVIDIA GPU(CUDA)対応を文書化しています。
- Apple Silicon。 candle-vllm、claude-code-local、exo、KoboldCpp、llama.cpp、LocalAI、MLC LLM、MLX-LM、mlx-serve、mlxcel、oMLX、Rapid-MLX、Shimmy、SwiftLM、text-generation-webui、TurboFieldfare、vllm-mlxは、Apple Silicon、MetalまたはMLXへの対応を文書化しています。
- AMD GPU。 KoboldCpp、llama.cpp、LocalAI、Lucebox、MLC LLM、SGLang、Shimmy、text-generation-webui、vLLMは、AMD GPU対応を文書化しています。
- CPU推論。 exo、KoboldCpp、llama.cpp、LocalAI、OlliteRT、SGLang、text-generation-webui、vLLMは、CPUでの推論の実行を文書化しています。
- マルチGPUとマルチノード。 candle-vllm、NVIDIA Dynamo、ExLlamaV2、exo、KServe、LMDeploy、LocalAI、LoRAX、Lucebox、MLX-LM、mlxcel、oMLX、SGLang、vLLMは、マルチGPU、テンソル並列、またはマルチノードでの推論を文書化しています。
- ライセンス。 ここに挙げたエンジンの多くはApache-2.0(19ツール)またはMIT(9ツール)で、KoboldCppとtext-generation-webuiはAGPL-3.0です。コピーレフトライセンスは、改変版の配布に条件を課します。詳しくはAI Tool Licenses Explainedを参照してください。
ランタイムとマネージャー:違いはどこにあるか
- OpenAI互換API。 Docker Model Runner、Foundry Local、GPUStack、Jan、Lemonade、Osaurusは、OpenAI互換APIを文書化しています。
- デスクトップアプリ。 GPT4All、Jan、LM Studio、Osaurus、Ypipeは、インストール可能なデスクトップアプリを文書化しています。
- 内蔵モデルライブラリ。 Foundry Local、GPUStack、Jan、Lemonade、LM Studio、Ollamaは、モデルを探してダウンロードする内蔵の仕組みを文書化しています。
- ヘッドレス・サーバーモード。 DreamServer、GPUStack、Lemonade、Osaurusは、GUIなしでバックグラウンドサービスまたはサーバーとして動作することを文書化しています。
- ライセンスと価格。 ここに挙げたランタイムのうち、4つはApache-2.0、4つはMITです。LM StudioとDocker Model Runnerはプロプライエタリです(LM Studioは無料で利用でき、Docker Model RunnerはDocker Desktopに同梱されています)。Mstyはクローズドソースで無料プランがあり、RunAnywhereとYPipeは独自またはドキュメント化されていない条件を採用しています。各レビューで確認してください。
ルーターとゲートウェイ:違いはどこにあるか
- OpenAI互換エンドポイント。 AIClient2API、litellmは、OpenAI互換エンドポイントを文書化しています。
- ローカルモデルへのルーティング。 litellmは、対応プロバイダーの中にローカルまたはセルフホストのモデル(Ollamaなど)があることを文書化しています。
- フォールバックとロードバランシング。 AIClient2API、ClawRouter、litellmは、モデルまたはプロバイダー間のフォールバック、リトライ、ロードバランシングを文書化しています。
- ライセンス。 4つのうち2つはMIT、1つはGPL-3.0、1つはApache-2.0です。
この比較でわからないこと
- この比較は文書化された機能を比べるものであり、性能ではありません。1秒あたりのトークン数、メモリ使用量、レイテンシについては何も示していません。PromptQuorumはこれらのツールでそれらを測定しておらず、結果はハードウェアとモデルに大きく左右されます。
- ダッシュは、確認したドキュメントに記載がないという意味であり、否定的な結果ではありません。READMEに書かれていなくても、その機能に対応しているツールがある可能性があります。READMEが短く記載の少ない、広く使われている一部のツール(たとえばOllamaのエンジン機能)で特に目立ちます。
- ハードウェア対応はドキュメントに記載された内容であり、そのハードウェアで良い使用感が得られることの保証ではありません。実際の要件はツールのレビューで確認してください。
- ツールは急速に変化します。各ツールのレビューには確認したバージョンが記載されており、本ガイドはレビューが更新されるときに更新されます。
よくある質問
推論エンジン、ランタイム、ゲートウェイの違いは何ですか?
推論エンジンは、お使いのハードウェア上でモデルを実行するものです(例:llama.cppやvLLM)。ランタイムやマネージャーは、モデルをダウンロードして実行を代行するもので、デスクトップアプリやモデルライブラリを備えていることが多いです(例:OllamaやLM Studio)。ルーターやゲートウェイは、1つ以上のモデルやプロバイダーの前段に置かれ、リクエストを転送します。役割が異なるため、別々に比較しています。
比較表のダッシュは何を意味しますか?
プロジェクト自身のドキュメントにその属性の記載がないことを意味します。その機能がないという意味ではありません。ツールのレビューやリポジトリで確認してください。
なぜOllamaは2つのグループに入っているのですか?
Ollamaは推論エンジンであると同時に、モデルを管理するランタイムでもあるため、両方に掲載しています。READMEにはここで比較している属性がほとんど記載されていないため、多くのセルがダッシュになっています。
これらのツールにアフィリエイトリンクはありますか?
いいえ。執筆時点で、PromptQuorumはこの比較に含まれるどのツールともアフィリエイト関係になく、ここにあるリンクから報酬が発生することもありません。
この比較はどのくらいの頻度で更新されますか?
年2回、および掲載ツールのレビューが更新されるたびに更新します。表はそれらのレビューと同じデータから生成されているためです。
出典
- 各ツールの公式READMEまたはウェブサイト。そのツールのPromptQuorumレビューに記載しています(比較表からリンク)。
- PromptQuorumのローカルAIアプリディレクトリ — 表の各行の生成元となるレコードです。
- AI Tool Licenses Explained — 上で挙げたライセンスの種類の意味を解説しています。