Skip to main content
PromptQuorum
ホーム/ローカルLLM活用/LoRAXレビュー:1つのGPUで数千のLoRAアダプターを配信
Overview & Reference

LoRAXレビュー:1つのGPUで数千のLoRAアダプターを配信

·10分で読める·Hans Kuepper 著 · PromptQuorumの創設者、マルチモデルAIディスパッチツール · PromptQuorum

LoRAXは、ファインチューニング済みモデルごとに専用GPUを必要とする代わりに、1つの共有ベースモデル上で多数のファインチューニング済みLoRAアダプターを1つのGPUで配信する、無料・オープンソースのセルフホスト型推論サーバーです。 Predibase(2025年にRubrikに買収)が開発し、Apache 2.0ライセンスで提供されるこのツールは、Hugging Faceのtext-generation-inferenceのフォークであり、動的なアダプター読み込み、アダプター間の異種連続バッチ処理、OpenAI互換APIを追加しています。これにより、公式の位置づけによれば、1つのデプロイで「1つ分の価格で」数千のアダプターを配信できます。

LoRAX(「LoRA eXchange」、github.com/predibase/lorax)は、アダプターごとにGPUを用意することなく、1つの共有ベースモデル上で多数のファインチューニング済みLoRAアダプターを配信するために特化して作られた、無料・オープンソースのセルフホスト型推論サーバーです。2021年設立のMLプラットフォーム企業Predibaseによって開発され、2025年にデータセキュリティ企業Rubrikに買収されました。このレビューでは、LoRAXが実際に何をするか、汎用の推論エンジンとの違い、インストール方法、そしてどのような人に向いているかを解説します。

重要なポイント

  • LoRAX(github.com/predibase/lorax)は無料・オープンソース・セルフホスト型のマルチLoRA推論サーバー
  • GoogleとUberの出身者が2021年に設立したMLプラットフォーム企業Predibaseが開発。Rubrikは2025年6月25日にPredibaseの買収を発表した
  • Apache 2.0ライセンスで提供され、プロジェクトによれば商用利用も無料
  • Hugging Faceのtext-generation-inference(v0.9.4以降)のフォークで、その後動的なマルチLoRAアダプター読み込みが追加された
  • NVIDIA GPU(Ampere世代以降)、CUDA 11.8以上、Linux環境が必要
  • PEFTまたはLudwigで訓練されたアダプターに対応。HuggingFace Hub、Predibase、ローカルファイルシステムパスから読み込む
  • このレビュー時点でGitHubスター3,800以上、フォーク324以上

📍 一文で説明

LoRAXは、Predibase(2025年にRubrikに買収)が開発した、Hugging Faceのtext-generation-inferenceをフォークした無料・オープンソース(Apache 2.0)のセルフホスト型推論サーバーで、1つのGPU上で共有ベースモデルに対する数千のファインチューニング済みLoRAアダプターを配信し、GitHubスターは3,800を超えています。

💬 簡潔に説明

ベースLLMのファインチューニング済みバリエーションごとにGPUホスト型モデルを個別に稼働させる代わりに、LoRAXはベースモデルの共有コピーを1つ読み込み、リクエストごとに小さなLoRAアダプターの重みを動的に入れ替えます。これにより、1つのGPUで同じモデルの異なる複数の「人格」を同時に配信でき、モデルごとにGPUを1台使う場合と比べてコストを大幅に削減できます。

📌補足: このレビューはLoRAX自身のGitHubリポジトリ、README、リリースノートに基づいています。PromptQuorumが他の推論サーバーとスループットやレイテンシを独自にベンチマーク比較したという主張はしていません。本番環境のサイジング判断の前に、最新の性能数値はプロジェクト自身のドキュメントで確認してください。

LoRAXとは?

LoRAX(「LoRA eXchange」)は、ファインチューニングごとに専用のモデルデプロイを必要とする代わりに、1つの共有ベースモデル上で多数のファインチューニング済みLoRAアダプターを配信するために特化して作られたセルフホスト型推論サーバーです。 公式の位置づけによれば、「1つ分の価格で本番環境に数百のファインチューニング済みLLMを配信するためのオープンソースフレームワーク」です。

  • 製品タイプ:セルフホスト型推論サーバー(CLI+ライブラリ)。ホスト型APIやデスクトップアプリではない
  • 開発元:Predibase。GoogleとUberの出身者が2021年にMLプラットフォーム企業として設立
  • 企業ステータス:データセキュリティ企業Rubrikは2025年6月25日にPredibase買収の合意を発表。Predibaseの商用プラットフォームは現在Rubrikの傘下に位置づけられているが、オープンソースのLoRAXプロジェクト自体はPredibase組織のもとでGitHub上に公開され続けている
  • 基盤:Hugging Faceのtext-generation-inference(v0.9.4以降)をフォークし、その後動的なマルチアダプター配信のために特化して拡張された
  • ライセンス:Apache 2.0。GitHubリポジトリで確認済み
  • 規模:このレビュー時点でGitHubスター3,800以上、フォーク324以上

プロジェクトの歴史とバージョンの節目

LoRAXは2024年初頭の初期リリース以降、継続的に開発が続けられており、バージョンごとに幅広いモデル対応、量子化オプション、配信機能を追加してきました。 以下のバージョン番号と日付はプロジェクト自身のGitHubリリースノートに基づいています。このレビューの公開日以降に出たものについては、リリースページを直接確認してください。

  1. 1
    v0.6.0 — 2024年1月10日:OpenAI互換API
    Why it matters: OpenAI互換のcompletionsおよびchat-completionsエンドポイントを追加し、既存のOpenAIクライアントコードをセルフホスト型のLoRAXサーバーに向けられるようにした。
  2. 2
    v0.7.0 — 2024年2月1日:マルチアダプターのマージ、EETQ/HQQ量子化
    Why it matters: linear、TIES、DAREの各手法を使い、リクエストごとに複数のLoRAアダプターをマージできるようにし、量子化フォーマットを2つ追加した。
  3. 3
    v0.8.0〜v0.8.1 — 2024年2月:構造化出力とGemma対応
    Why it matters: Outlinesライブラリを介したJSONスキーマ誘導の構造化出力と、GoogleのGemmaモデルファミリーへの対応を追加した。
  4. 4
    v0.9.0 — 2024年3月23日:専用アダプターメモリ、Qwen2対応
    Why it matters: リリースノートによれば、アダプター用にGPUメモリを専用に確保し、Qwen2モデルへの対応を追加した。
  5. 5
    v0.10.0 — 2024年5月23日:Medusa推測デコーディング
    Why it matters: Medusa推測デコーディングアダプターと、Phi-3、Command-R、DBRXモデルへの対応を追加し、生成の高速化を狙った。
  6. 6
    v0.11.0 — 2024年9月18日:プレフィックスキャッシュ、Vision-Language対応
    Why it matters: 繰り返しプロンプト向けのプレフィックスキャッシュ、Vision-LanguageモデルLlava-Nextへの対応、MistralおよびLlamaモデル向けのFP8量子化を追加した。
  7. 7
    v0.12.0 — 2024年11月6日:マルチLoRAプレフィックスキャッシュ、Function Calling
    Why it matters: プレフィックスキャッシュを複数アダプター間で同時に機能するよう拡張し、FP8 KVキャッシュ対応、スキーマ強制付きのFunction Callingを追加した。変更履歴によれば、このレビューが公開されているリリースノートから確認できた最新の節目である。

LoRAXは実際に何をするのか?

LoRAXは1つの共有ベースモデルをGPUメモリに読み込み、受信したリクエストごとに小さなLoRAアダプターの重みを動的に読み込んで入れ替えます。これにより、1つのデプロイから多数のファインチューニング済みモデルバリエーションを配信できます。

  • 動的アダプター読み込み — すべてのアダプターを事前に読み込む必要はなく、リクエストごとにオンデマンドでLoRAアダプターを読み込む。GPUとCPUメモリ間で非同期のプリフェッチとオフロードを行い、どのアダプターを「ホット」に保つかを管理する
  • 異種連続バッチ処理 — 公式のアーキテクチャ説明によれば、アダプターごとに個別のバッチを必要とするのではなく、異なるアダプターを対象とするリクエストを同じバッチにまとめる
  • ベースモデル対応 — リリースノートによれば、Llama、CodeLlama、Mistral、Zephyr、Qwen、Gemma、Phi-3、Command-R、DBRX、ならびにVision-LanguageモデルのMllama/Llava-Nextに対応
  • 量子化オプション — fp16、またはbitsandbytes、GPT-Q、AWQ、EETQ、HQQによる量子化。後のリリースではFP8 KVキャッシュ対応も追加
  • アダプター互換性PEFTまたはLudwigで訓練されたアダプターに対応し、HuggingFace Hub、Predibase、ローカルファイルシステムパスから読み込み可能
  • OpenAI互換API — OpenAIのリクエスト/レスポンス形式でchat-completionsおよびcompletionsエンドポイントを公開し、既存のOpenAIクライアントコードをセルフホスト型のLoRAXサーバーに向けられる
  • 配信インフラ機能 — ドキュメントによれば、テンソル並列処理、flash-attention、paged attention、トークンストリーミング、Prometheusメトリクス、OpenTelemetryトレーシングに対応
  • 構造化出力 — Outlinesライブラリを介したJSONスキーマ誘導の生成に加え、後のリリースではスキーマ強制付きのFunction Callingにも対応

利用例:LoRAXを使う3つの方法

これらはLoRAX自身のドキュメント化された機能から構成された具体的なワークフローであり、仮定的なユースケースではありません。

プラットフォーム、料金、ライセンス

プラットフォーム

LoRAXの提示内容:
セルフホスト型、Linuxのみ。NVIDIA GPU(Ampere世代以降)とCUDA 11.8以上が必要。

費用

LoRAXの提示内容:
無料・オープンソースで、商用利用も無料と説明されている。支払うのは自身のGPUインフラのみ — 別途有料のLoRAXプランは存在しない。

ライセンス

LoRAXの提示内容:
Apache 2.0。GitHubリポジトリで確認済み。

インストール方法

LoRAXの提示内容:
Dockerイメージ(ghcr.io/predibase/lorax:main)に加え、KubernetesおよびSkyPilotによるデプロイ手順も文書化されている。Pythonクライアントはpipで別途インストール。

Predibase(LoRAXの開発元。2025年の買収後は現在Rubrikの傘下に位置づけられている)は、関連技術を基にした別のマネージド商用プラットフォームも販売しています。セルフホストではなくマネージド提供が必要な場合は、現在の商用料金をPredibase/Rubrikに直接確認してください。

LoRAX vs. 汎用推論エンジン

LoRAXとLMDeployやNVIDIA Dynamoのような汎用推論エンジンは、どちらも大規模にLLMを配信しますが、LoRAXは特定の問題、すなわち1つのベースモデル上で多数のLoRAアダプターを低コストで配信することに特化して作られています。

項目
LoRAX
汎用推論エンジン
中心的な役割1つのベースモデル上で多数のLoRAアダプターを配信1つ以上の完全なモデルを高スループットで配信
マルチアダプターのバッチ処理異種連続バッチ処理を標準搭載通常は中心的な機能ではない
ベースHugging Faceのtext-generation-inferenceのフォークプロジェクトによって異なる
OpenAI互換APIあり多くの場合あり
最適な用途1つのベースモデルの多数のファインチューニング済みバリエーションモデル数は少なく最大の生スループットを重視

ワークロードが同じベースモデルの多数のファインチューニング済みバリエーション(顧客別やタスク別のアダプター)を配信するものであれば、LoRAXのアダプター重視のバッチ処理はまさにそのために作られています。アダプター切り替えの必要がなく、少数の異なる完全なモデルを最大の生スループットで配信するのであれば、汎用エンジンの方が適する場合があります。両プロジェクトとも頻繁に性能改善を出しているため、選択前に各プロジェクト自身のサイトで最新のベンチマークを確認してください。

LoRAXはどんな人向けか?

LoRAXは、同じベースモデルの多数のファインチューニング済みLoRAアダプターを持っている、または持つ予定があり、それらを共有GPUキャパシティから費用対効果高く配信したいチームに適しています。

LoRAXが向いていないケース

CPU専用または非Linux環境でのデプロイ、アダプターの配信ではなく訓練、あるいは完全にマネージドなホスト型プラットフォームが必要な場合、LoRAXは適していません。

  • CPU専用ではない — NVIDIA GPU(Ampere世代以降)とCUDA 11.8以上が必要。CPUフォールバックモードはない
  • サーバー自体はクロスプラットフォームではない — 公式ドキュメントによれば、LoRAXのサーバーはLinuxのみで動作する
  • 訓練ツールではない — LoRAXは他所(PEFTやLudwigなど)ですでに訓練されたLoRAアダプターを配信する。自らモデルをファインチューニングすることはない
  • 単体ではマネージドなホスト型サービスではない — セルフホスト型のオープンソースソフトウェアである。マネージドなオプションが必要であれば、Predibaseの別の商用プラットフォーム(2025年の買収後は現在Rubrik傘下に位置づけられている)が選択肢になる
  • PromptQuorumがスループットやレイテンシを独自にベンチマークしたものではない — このレビューはLoRAX自身のドキュメントとリリースノートに基づいており、実機テストによるものではない

LoRAX評価でよくある誤解

LoRAXをめぐる混乱の多くは、アダプターを訓練してくれると期待すること、GPUなしで動作すると考えること、またはPredibaseの買収後も企業としての後ろ盾が変わっていないと思い込むことから生じます。

競合とその代替ツール

LoRAXは、推論配信とLoRAファインチューニングという2つの領域の交差点に位置するため、他のセルフホスト型の推論・ファインチューニングツールと比較されることが最も多いです。 Local LLM Software Directory内のLoRAX自身のエントリーと併せてご覧ください。

Tool
Best known for
Link
LMDeploy量子化と配信ツールキットを備えたオープンソースの推論エンジンLMDeployレビュー
NVIDIA DynamoAPIサーバー機能を備えた高スループットの推論配信フレームワークNVIDIA Dynamoレビュー
Unsloth高速でメモリ効率の良いLoRA/QLoRAファインチューニングライブラリUnslothレビュー
LLaMA-FactoryLoRAや他のPEFT手法に対応する統合ファインチューニングフレームワークLLaMA-Factoryレビュー

このリストはLoRAXと同じ推論配信・LoRAファインチューニング領域のツールを示したものであり、PromptQuorumによる独自のランキングではありません。LoRAXのマルチアダプター配信への注力は汎用推論エンジンや訓練専用ツールと同一ではないため、選択前に各ツールの現在の機能セットを確認してください。

よくある質問

LoRAXとは何ですか?

LoRAX(「LoRA eXchange」、github.com/predibase/lorax)は、1つのGPU上で共有ベースモデルに対する多数のファインチューニング済みLoRAアダプターを配信する、無料・オープンソースのセルフホスト型推論サーバーです。

LoRAXは無料ですか?

はい、LoRAX自体は無料・オープンソース(Apache 2.0)で、プロジェクトによれば商用利用も無料です。支払うのはそれを実行するための自身のGPUインフラのみです。

LoRAXは誰が開発しましたか?

LoRAXは、GoogleとUberの出身者が2021年に設立したMLプラットフォーム企業Predibaseが開発しました。データセキュリティ企業Rubrikは2025年6月25日にPredibase買収の合意を発表しました。

LoRAXにはどのGPUが必要ですか?

Linux上でNVIDIA GPU(Ampere世代以降)とCUDA 11.8以上が必要です。CPU専用モードやmacOS/Windowsネイティブのサーバーデプロイはありません。

LoRAXはどうやってインストールしますか?

Dockerイメージ(ghcr.io/predibase/lorax:main)を使ったセルフホスト型サーバーとして。KubernetesとSkyPilotによるデプロイ手順も文書化されています。Pythonクライアントはpip install lorax-clientで別途インストールします。

LoRAXはどのベースモデルに対応していますか?

リリースノートによれば、Llama、CodeLlama、Mistral、Zephyr、Qwen、Gemma、Phi-3、Command-R、DBRX、ならびにVision-LanguageモデルのMllama/Llava-Nextなどです。完全な最新リストは現在のドキュメントを確認してください。

LoRAXはLoRAアダプターを訓練しますか?

いいえ。LoRAXは、PEFT、Ludwig、または類似ツールですでに他所で訓練されたアダプターを配信する推論サーバーです。まずアダプターを作成する必要がある場合は、UnslothやLLaMA-Factoryなどの専用ファインチューニングツールと組み合わせてください。

LoRAXにはOpenAI互換APIがありますか?

はい。LoRAXはOpenAIのリクエスト/レスポンス形式でchat-completionsおよびcompletionsエンドポイントを公開しており、既存のOpenAIクライアントコードをセルフホスト型のLoRAXサーバーに向けることができます。

LoRAXはどの量子化フォーマットに対応していますか?

リリースノートによれば、fp16に加え、bitsandbytes、GPT-Q、AWQ、EETQ、HQQによる量子化、そして後のリリースで追加されたFP8 KVキャッシュ対応です。

PromptQuorumはLoRAXの性能に関する主張を独自にテストしましたか?

このレビューはLoRAX自身のGitHubリポジトリ、README、リリースノートに基づいており、PromptQuorumによる実機ベンチマークによるものではありません。本番環境のサイジング判断の前に、最新のスループットとレイテンシの数値はプロジェクト自身のドキュメントで直接確認してください。

ソース

← ローカルLLM活用 に戻る