Skip to main content
PromptQuorum
ホーム/ローカルLLM活用/ローカル推論エンジン・ランタイム・ゲートウェイ比較(2026):モデルの実行とサーブ
Overview & Reference

ローカル推論エンジン・ランタイム・ゲートウェイ比較(2026):モデルの実行とサーブ

·10分で読める·Hans Kuepper 著 · PromptQuorumの創設者、マルチモデルAIディスパッチツール · PromptQuorum

PromptQuorumディレクトリにあるローカル実行・サーブ系の46ツールは、別々に比較すべき3種類に分かれます。推論エンジン(30ツール)、ランタイム・マネージャー(13ツール)、ルーター・ゲートウェイ(4ツール)です。 エンジンのうち、15ツールがNVIDIA GPU対応を、17ツールがApple Silicon対応を、21ツールがOpenAI互換APIを文書化しています。ランタイムでは6ツールがOpenAI互換APIを文書化しています。下の比較表を使い、インストールする前に各ツールのレビューも読んでください。

自分のハードウェアでモデルを動かすには、3種類の異なるツールが関わります。モデルを実行する推論エンジン、モデルのダウンロードと実行を代行するランタイムやマネージャー、そしてそれらの前段に置かれるルーターやゲートウェイです。これらを公平に比べられる単一の機能一覧はありません。本ガイドでは、無料およびフリーミアムの46ツールを種類ごとに比較します。比較表は各ツールのPromptQuorumレビューと同じデータから生成されるため、表とレビューの内容が食い違うことはありません。

このページには参考用の第三者製品へのリンクが含まれています。PromptQuorumはいかなるアフィリエイトプログラムにも参加しておらず、これらはコミッションを得ない単なる参照リンクです。リンクのクリックと次のステップはご自身の責任です。これらのリンクはPromptQuorumによる推奨や検証を表すものではありません。

重要なポイント

  • 46ツール、3種類:推論エンジン(30)、ランタイム・マネージャー(13)、ルーター・ゲートウェイ(4)。Ollamaはエンジンでもありランタイムでもあるため、2つのグループに登場します。
  • 表は各ツールのレコードから生成され、公式のREADMEまたはサイトと照合しています。ダッシュは「ドキュメントに記載なし」の意味であり、「非対応」ではありません。よく知られた一部のツールでは、ここで参照したドキュメントが特定の機能に触れていないため、該当セルはダッシュになっています。
  • 表の各ツール名は、そのツール専用のPromptQuorumレビューにリンクしています。インストール手順や制約はそちらで扱っています。

📍 一文で説明

モデルをローカルで動かすには、推論エンジン、ランタイム・マネージャー、ルーター・ゲートウェイの3種類のツールが関わるため、PromptQuorumディレクトリの46ツールは種類ごとに比較しています。比較表は、各ツールのレビューと同じツールデータから生成されています。

💬 簡潔に説明

エンジンは実際にモデルを動かす部分、ランタイムやマネージャーはモデルのダウンロードと実行を代行するもの、ゲートウェイはそれらの間でリクエストを振り分けるものです。エンジンとゲートウェイをGPU対応で比べても意味がないため、本ガイドでは同じ種類同士を比較します。

比較の方法

各ツールの情報(価格、ライセンス、対応プラットフォーム、ハードウェア要件、カテゴリ固有の属性)は、そのツールのディレクトリレコードに一度だけ保存されています。下の比較表はそのレコードから生成され、ツール個別のレビューも同じレコードを参照するため、両者が異なる値を示すことはありません。

カテゴリ固有の属性(たとえばOpenAI互換APIやAMD GPU対応)は、各プロジェクトの公式READMEまたはウェブサイトから取得し、そこに書かれた文言と照合しました。ドキュメントに記載がない場合は、推測せずに表にダッシュを表示します。記述に条件が付く場合(実験的、計画中、別プロジェクト経由でのみ利用可能など)は、その属性を表から外し、ツールのレビューで扱います。

表に載っているのは、PromptQuorumに専用レビューがあるツールのみです。APIサーバーとしてのみ掲載しているツール(h2oGPT、Tabby、OpenAI Edge TTS)は、それぞれのカテゴリで比較しています。この比較は自分のハードウェアで動くツールを一覧にしたもので、順位付けはしていません。適切なツールは条件によって変わるためです。

比較表

以下でツールの種類を選び、行を横に読み進めてください。ツール名をクリックすると、PromptQuorumの詳しいレビューが開きます。

ツール価格ライセンスプラットフォーム動作環境ハードウェアバージョンOpenAI互換APINVIDIA GPUApple SiliconAMD GPUCPU推論マルチGPU/マルチノードレビュー製品リンク · 開示済み
candle-vllm無料MITmacOS, Windows, Linuxローカルモデルにより異なるv0.9.1はいはいはいはいレビューを読むcandle-vllm
claude-code-local無料MITmacOSローカルモデルにより異なるv0.3.0はいレビューを読むclaude-code-local
ExLlamaV2無料MITWindows, LinuxローカルVRAM 8 GBv0.3.2はいはいレビューを読むExLlamaV2
exo無料Apache-2.0macOS, Linuxローカルモデルにより異なるはいはいはいはいレビューを読むexo
KoboldCpp無料AGPL-3.0Windows, Linux, macOSローカルモデルにより異なるv1.121はいはいはいはいはいレビューを読むKoboldCpp
KServe無料Apache-2.0LinuxローカルCPUで十分v0.20.0はいはいレビューを読むKServe
llama.cpp無料MITmacOS, Windows, Linuxローカルモデルにより異なるv0.4.1はいはいはいはいはいレビューを読むllama.cpp
Llamafile無料Apache-2.0macOS, Windows, Linuxローカルモデルにより異なる0.10.6レビューを読むLlamafile
LMDeploy無料Apache-2.0Linuxローカルモデルにより異なるv0.17.0はいはいレビューを読むLMDeploy
LocalAI無料MITmacOS, Windows, Linuxローカルモデルにより異なるはいはいはいはいはいはいレビューを読むLocalAI
LoRAX無料Apache-2.0Linuxローカルモデルにより異なるv0.12.1はいはいはいレビューを読むLoRAX
Lucebox無料Apache-2.0Linuxローカルモデルにより異なるはいはいはいはいレビューを読むLucebox
MLC LLM無料Apache-2.0macOS, Windows, Linux, iOS, Androidローカルモデルにより異なるはいはいはいはいレビューを読むMLC LLM
MLX-LM無料MITmacOSローカルモデルにより異なるはいはいレビューを読むMLX-LM
mlx-serve無料MITmacOSローカルモデルにより異なるv26.9.4はいはいレビューを読むmlx-serve
mlxcel無料Apache-2.0macOS, Linuxローカルモデルにより異なるv0.7.0はいはいはいはいレビューを読むmlxcel
NVIDIA Dynamo無料Apache-2.0Linuxローカルモデルにより異なるv1.4–v1.6はいはいレビューを読むNVIDIA Dynamo
Ollama無料MITmacOS, Windows, Linuxローカルモデルにより異なるレビューを読むOllama
OlliteRT無料Apache-2.0AndroidローカルCPUで十分はいはいレビューを読むOlliteRT
oMLX無料Apache-2.0macOSローカルモデルにより異なるv0.6.4はいはいはいレビューを読むoMLX
OpenLLM無料Apache-2.0ハイブリッドモデルにより異なるはいレビューを読むOpenLLM
Rapid-MLX無料Apache-2.0macOSローカルRAM 8 GBはいはいレビューを読むRapid-MLX
SGLang無料Apache-2.0Linuxローカルモデルにより異なるはいはいはいはいレビューを読むSGLang
Shimmy無料Apache-2.0macOS, Windows, Linuxローカルモデルにより異なるはいはいはいはいレビューを読むShimmy
SwiftLM無料MITmacOS, iOSローカルモデルにより異なるはいはいレビューを読むSwiftLM
TensorRT-LLM無料Apache-2.0Windows, Linuxローカルモデルにより異なるはいレビューを読むTensorRT-LLM
text-generation-webui無料AGPL-3.0Windows, Linux, macOSローカルモデルにより異なるはいはいはいはいはいレビューを読むtext-generation-webui
TurboFieldfare無料Apache-2.0macOSローカルRAM 2 GBはいレビューを読むTurboFieldfare
vLLM無料Apache-2.0Linuxローカルモデルにより異なるはいはいはいはいはいレビューを読むvLLM
vllm-mlx無料Apache-2.0macOSローカルモデルにより異なるはいはいレビューを読むvllm-mlx

「—」は、そのプロジェクト自身のドキュメントに記載がないことを示すもので、機能がないという意味ではありません。値は各プロジェクトの公式READMEまたはサイトから取得し、ツールのレビューを更新する際に再確認しています。

推論エンジン:違いはどこにあるか

ランタイムとマネージャー:違いはどこにあるか

  • OpenAI互換API。 Docker Model RunnerFoundry LocalGPUStackJanLemonadeOsaurusは、OpenAI互換APIを文書化しています。
  • デスクトップアプリ。 GPT4AllJanLM StudioOsaurusYpipeは、インストール可能なデスクトップアプリを文書化しています。
  • 内蔵モデルライブラリ。 Foundry LocalGPUStackJanLemonadeLM StudioOllamaは、モデルを探してダウンロードする内蔵の仕組みを文書化しています。
  • ヘッドレス・サーバーモード。 DreamServerGPUStackLemonadeOsaurusは、GUIなしでバックグラウンドサービスまたはサーバーとして動作することを文書化しています。
  • ライセンスと価格。 ここに挙げたランタイムのうち、4つはApache-2.0、4つはMITです。LM StudioとDocker Model Runnerはプロプライエタリです(LM Studioは無料で利用でき、Docker Model RunnerはDocker Desktopに同梱されています)。Mstyはクローズドソースで無料プランがあり、RunAnywhereとYPipeは独自またはドキュメント化されていない条件を採用しています。各レビューで確認してください。

ルーターとゲートウェイ:違いはどこにあるか

  • OpenAI互換エンドポイント。 AIClient2APIlitellmは、OpenAI互換エンドポイントを文書化しています。
  • ローカルモデルへのルーティング。 litellmは、対応プロバイダーの中にローカルまたはセルフホストのモデル(Ollamaなど)があることを文書化しています。
  • フォールバックとロードバランシング。 AIClient2APIClawRouterlitellmは、モデルまたはプロバイダー間のフォールバック、リトライ、ロードバランシングを文書化しています。
  • ライセンス。 4つのうち2つはMIT、1つはGPL-3.0、1つはApache-2.0です。

この比較でわからないこと

  • この比較は文書化された機能を比べるものであり、性能ではありません。1秒あたりのトークン数、メモリ使用量、レイテンシについては何も示していません。PromptQuorumはこれらのツールでそれらを測定しておらず、結果はハードウェアとモデルに大きく左右されます。
  • ダッシュは、確認したドキュメントに記載がないという意味であり、否定的な結果ではありません。READMEに書かれていなくても、その機能に対応しているツールがある可能性があります。READMEが短く記載の少ない、広く使われている一部のツール(たとえばOllamaのエンジン機能)で特に目立ちます。
  • ハードウェア対応はドキュメントに記載された内容であり、そのハードウェアで良い使用感が得られることの保証ではありません。実際の要件はツールのレビューで確認してください。
  • ツールは急速に変化します。各ツールのレビューには確認したバージョンが記載されており、本ガイドはレビューが更新されるときに更新されます。

よくある質問

推論エンジン、ランタイム、ゲートウェイの違いは何ですか?

推論エンジンは、お使いのハードウェア上でモデルを実行するものです(例:llama.cppやvLLM)。ランタイムやマネージャーは、モデルをダウンロードして実行を代行するもので、デスクトップアプリやモデルライブラリを備えていることが多いです(例:OllamaやLM Studio)。ルーターやゲートウェイは、1つ以上のモデルやプロバイダーの前段に置かれ、リクエストを転送します。役割が異なるため、別々に比較しています。

比較表のダッシュは何を意味しますか?

プロジェクト自身のドキュメントにその属性の記載がないことを意味します。その機能がないという意味ではありません。ツールのレビューやリポジトリで確認してください。

なぜOllamaは2つのグループに入っているのですか?

Ollamaは推論エンジンであると同時に、モデルを管理するランタイムでもあるため、両方に掲載しています。READMEにはここで比較している属性がほとんど記載されていないため、多くのセルがダッシュになっています。

これらのツールにアフィリエイトリンクはありますか?

いいえ。執筆時点で、PromptQuorumはこの比較に含まれるどのツールともアフィリエイト関係になく、ここにあるリンクから報酬が発生することもありません。

この比較はどのくらいの頻度で更新されますか?

年2回、および掲載ツールのレビューが更新されるたびに更新します。表はそれらのレビューと同じデータから生成されているためです。

出典

← ローカルLLM活用 に戻る