Skip to main content
PromptQuorum
ホーム/ローカルLLM/低スペックPC向け最速ローカルLLM 2026:CPU専用ガイド
ユースケース別モデル

低スペックPC向け最速ローカルLLM 2026:CPU専用ガイド

·8分で読める·Hans Kuepper 著 · PromptQuorumの創設者、マルチモデルAIディスパッチツール · PromptQuorum

低スペックPC(CPU専用、RAM 8 GB)で最速のローカルLLMはQwen3 1.7B(Q4_K_M)— 最新のi5/Ryzen 5で25〜40トークン/秒。8 GBで良質な結果が欲しい場合はPhi-4-mini(3.8B)が15〜25トークン/秒で動作し、コーディングと推論によく対応します。本ガイドのすべてのモデルはGPUなしで動作します。

CPU専用、RAM 8 GB:Qwen3 1.7B Q4_K_Mが最新のi5/Ryzen 5で25〜40トークン/秒を達成。Phi-4-mini(3.8B)は15〜25トークン/秒で動作し、コーディングと推論に対応。本ガイドのすべてのモデルはGPUなしで動作します。 2026年7月現在、専用GPUなしの古いノートPCでも実用的なローカルLLMを実行できます。本ガイドは4GB CPU専用から16GB+Intel Iris iGPUまでのハードウェア階層をカバーし、各層のOllamaコマンドを掲載します。

低スペックPC向け最速ローカルLLM(2026年)

速度はハードウェア階層によって決まります。CPU/RAMを正しいモデルに合わせましょう — 選択を誤ると4〜10倍の速度を無駄にします。

  • RAM 4 GB、CPU専用: Qwen3 1.7B Q4_K_M — 最新のi5/Ryzen 5で25〜40トークン/秒。`ollama run qwen3:1.7b`
  • RAM 8 GB、CPU専用: Phi-4-mini(3.8B)— 15〜25トークン/秒、コーディングと推論に対応。`ollama run phi4-mini`
  • RAM 8 GB + Intel Iris iGPU: Qwen3 4B — 部分オフロードで12〜20トークン/秒。`ollama run qwen3:4b`
  • RAM 16 GB、CPU専用: Qwen3 8B Q4_K_M — 8〜15トークン/秒、高い品質。`ollama run qwen3:8b`

ほとんどの低スペックPCでは、Phi-4-mini(3.8B)のQ4_K_Mがスイートスポットです — RAM 8GBに収まり、CPUで15〜25トークン/秒。最速の応答が欲しい場合はQwen3 1.7Bに切り替えてください。

スライドデッキ: 低スペックPC向け最速ローカルLLM 2026:CPU専用ガイド

14スライドのインタラクティブ資料:低スペックPC向け最速ローカルLLM。RAM 4GB CPU専用(Qwen3 1.7B、25〜40トークン/秒)、スイートスポットのRAM 8GB CPU専用(Phi-4-mini、15〜25トークン/秒)、RAM 16GB CPU専用(Qwen3 8B、8〜15トークン/秒)、およびiGPUで強化された階層。ハードウェア別モデル決定表、正確なRAM数値付きの階層別推奨、量子化ガイド(Q4/Q3/Q2)、速度体感の閾値、よくある間違いを網羅。PDFをローカルLLMハードウェア参照カードとしてダウンロード。

以下のスライドを閲覧するか、PDFとしてダウンロードしてください。 リファレンスカードをダウンロード(PDF)

低スペックPC向け最速ローカルLLM 2026:CPU専用ガイド

重要なポイント

  • RAM 4 GB、CPU専用: Qwen3 1.7B Q4_K_M — 25〜40トークン/秒。最小ハードウェアで最速の応答。
  • RAM 8 GB、CPU専用(スイートスポット): Phi-4-mini 3.8B Q4_K_M — 15〜25トークン/秒。古いノートPCでコーディングと推論。
  • RAM 8 GB + Intel Iris iGPU: Qwen3 4B — 部分GPUオフロードで12〜20トークン/秒。
  • RAM 16 GB、CPU専用: Qwen3 8B Q4_K_M — 8〜15トークン/秒。GPU不要で高い品質。
  • RAM 16 GB + iGPU: Llama 3.2 3BまたはQwen3 4B — レイヤーオフロードで20〜35トークン/秒。
  • 結論: ほとんどの低スペックPCでは、Phi-4-mini(3.8B)のQ4_K_Mがスイートスポットです — RAM 8GBに収まり、CPUで15〜25トークン/秒。最速の応答が欲しい場合はQwen3 1.7Bに切り替えてください。
  • コスト: すべて無料(オープンソース)vs. ChatGPT API(1,000トークンあたり約$0.002)。

📍 一文で説明

RAM 8 GBのCPUのみのPCでは、Phi-4-mini 3.8B Q4_K_MがコーディングOK・15〜25トークン/秒で動作。RAM 4 GBでは、Qwen3 1.7B Q4_K_Mが25〜40トークン/秒を達成。

💬 簡潔に説明

ローカルAIを動かすためにゲーミングGPUは必要ありません。これらのモデルはCPUと通常のRAMだけで動作します。小さめのモデル(1〜4Bパラメータ)は日常的なタスクに意外なほど有能で、会話にも十分な速度があります。

あなたのハードウェアに最速のモデルは?

ハードウェアに合ったモデルを選択してください — 誤った選択で4〜10倍の速度を無駄にします。以下の階層は特記なき限りすべてCPU専用です。

お使いのハードウェア推奨モデルOllamaコマンド期待速度
RAM 4 GB、CPU専用Qwen3 1.7B Q4_K_Mollama run qwen3:1.7b25〜40トークン/秒
RAM 8 GB、CPU専用Phi-4-mini 3.8B Q4_K_Mollama run phi4-mini15〜25トークン/秒
RAM 8 GB + Intel Iris iGPUQwen3 4B Q4_K_Mollama run qwen3:4b12〜20トークン/秒
RAM 16 GB、CPU専用Qwen3 8B Q4_K_Mollama run qwen3:8b8〜15トークン/秒
RAM 16 GB + iGPULlama 3.2 3B Q4_K_Mollama run llama3.2:3b20〜35トークン/秒

どのモデルを使うべきか?

あなたの状況に合ったモデルを選びましょう — これが最も重要な決定です:

  • RAM 8 GBのノートPC(専用GPUなし): Phi-4-mini(3.8B)Q4_K_M — 15〜25トークン/秒、コーディングと推論に対応。`ollama run phi4-mini`
  • RAM 4 GB、非常に古いPC: Qwen3 1.7B Q4_K_M — 25〜40トークン/秒、最小RAMで最速の応答。`ollama run qwen3:1.7b`
  • RAM 16 GB、GPUなし: Qwen3 8B Q4_K_M — 8〜15トークン/秒、高い品質。`ollama run qwen3:8b`
  • RAM 8 GB + Intel Iris iGPU: Qwen3 4B — `OLLAMA_NUM_GPU=1`で部分オフロード、12〜20トークン/秒。`ollama run qwen3:4b`
  • 多言語対応(128Kコンテキスト)が欲しい: Qwen3 4BまたはLlama 3.2 3B — どちらもOllamaで128Kコンテキストに対応。
  • RAM階層別の推奨と発熱対策については ノートPCでローカルLLMを実行する方法を参照。

ハードウェア別おすすめローカルLLM

以下の階層はすべてCPU専用またはiGPUです。Q4_K_Mであなたのお使いのRAMに収まる最大のモデルを選んでください — 量子化は小型モデルへの変更よりも品質低下が少ない。

HardwareModelQuantSpeedExperience
RAM 4 GB、CPU専用Qwen3 1.7BQ4_K_M25〜40 t/s高速、使える品質
RAM 8 GB、CPU専用Phi-4-mini 3.8BQ4_K_M15〜25 t/sコーディング+推論
RAM 8 GB + iGPU IrisQwen3 4BQ4_K_M12〜20 t/s部分GPUオフロード
RAM 16 GB、CPU専用Qwen3 8BQ4_K_M8〜15 t/s高い品質
RAM 16 GB + iGPULlama 3.2 3BQ4_K_M20〜35 t/siGPUでスムーズ
ハードウェア階層別ローカルLLM速度(CPU専用とiGPU):RAM 4 GB(25〜40トークン/秒、Qwen3 1.7B)、RAM 8 GB CPU(15〜25トークン/秒、Phi-4-mini)、8 GB + iGPU Iris(12〜20トークン/秒)、16 GB CPU(8〜15トークン/秒)、16 GB + iGPU(20〜35トークン/秒)。2026年7月のベンチマーク。
ハードウェア階層別ローカルLLM速度(CPU専用とiGPU):RAM 4 GB(25〜40トークン/秒、Qwen3 1.7B)、RAM 8 GB CPU(15〜25トークン/秒、Phi-4-mini)、8 GB + iGPU Iris(12〜20トークン/秒)、16 GB CPU(8〜15トークン/秒)、16 GB + iGPU(20〜35トークン/秒)。2026年7月のベンチマーク。

GPU vs CPU:低スペックハードウェアでどちらが速い?

GPU推論: RTX 3060で15〜20トークン/秒。CUDAセットアップが必要。高速、最高品質。費用対効果の高い選択肢はバジェットGPUガイドを参照。

iGPU(統合グラフィックス): Intel Irisで5〜8トークン/秒。セットアップ不要。専用GPUより低速。

CPU推論: 最新マルチコアで1〜5トークン/秒。どこでも動作。最も低速。

ルール: GPUがあれば(統合でも)使用する。CPUは最終手段。

ローカルLLMのCPU vs GPU速度比較:CPU専用は10〜25トークン/秒(3Bモデル)および15〜40トークン/秒に到達。GPU(RTX 3060、8 GB)は25〜60トークン/秒に到達 — CPU専用推論より4〜10倍高速。
ローカルLLMのCPU vs GPU速度比較:CPU専用は10〜25トークン/秒(3Bモデル)および15〜40トークン/秒に到達。GPU(RTX 3060、8 GB)は25〜60トークン/秒に到達 — CPU専用推論より4〜10倍高速。

低スペックPCで小型モデルが速い理由

モデルサイズが速度を直接決定します。 1B〜3Bモデルはシステムメモリに完全に収まるため、CPUまたはGPUがデータを継続的にストリーミングできます。大型モデルはメモリスワッピングが必要 — RAMとディスク間でデータを移動することで生成速度が10〜100倍低下します(ボトルネックはディスクI/Oであり、計算ではない)。

上記のハードウェア判定テーブルはこの原則を反映しています:TinyLlama 1.1B(1Bパラメータ)は旧CPUで5〜10トークン/秒に到達しますが、スワッピングが支配的になるため13B+モデルは低スペックハードウェアには実用的ではありません。

  • 1B〜3Bモデル: 4〜8GB RAMに収まる → 最速生成 → 品質許容範囲
  • 7Bモデル: 8GBシステムでギリギリ → メモリプレッシャーで低速 → 高品質
  • 13B+モデル: 16GB+ VRAMまたはスワップが必要 → インタラクティブ使用には遅すぎる

低スペックPCでローカルLLMはどのくらい速い?

CPU専用システムで期待できる速度:

  • 3Bモデル → 15〜40トークン/秒(旧CPU:10〜15、最適化済み新CPU:30〜40)
  • 7Bモデル → 10〜25トークン/秒(CPUコアと量子化次第;積極的最適化で30+も可能)
  • クラウドAPIより低速(ChatGPT 4o:80〜150トークン/秒)ですが、インタラクティブ使用には十分です。 25トークン/秒の3Bモデルは500トークンのレスポンスを20秒で生成 — コードレビュー、要約、創作など時間に余裕のあるタスクに許容範囲。

量子化は低スペックPCの速度にどう影響する?

Q4(4ビット): 品質低下約1%、VRAM節約50%。標準選択。全量子化レベルの詳細はガイドを参照。

Q3(3ビット): 品質低下約3%、VRAM節約62%。チャットに許容範囲。

Q2(2ビット): 品質低下約10%、VRAM節約75%。リスクあり;OOM時のみ使用。

速度への影響: Q2はメモリ帯域幅削減によりQ4より約30%速い(計算ではない)。

戦略:小型モデル(TinyLlama)より大型モデルを量子化(Mistral Small Q2)。

Mistral Small Q2 > TinyLlama 1.1B Q4(速度・品質ともに)。

高速モデルは品質と引き換えに速度を得ていますが、温度とtop-pを調整することで多くの品質を回復できます。高速モデルに低い温度(0.1~0.3)を設定することで、デフォルト設定より一貫性のある出力が得られます。温度とtop-pについてで正確な設定を確認してください。

ローカルLLMの量子化トレードオフ:Q4(品質低下1%、VRAM節約50%、Mistral Smallで4.5GB)が標準。Q2は30%高速だが品質10%低下。Q8は避ける — VRAMコスト2倍で効果は最小限。
ローカルLLMの量子化トレードオフ:Q4(品質低下1%、VRAM節約50%、Mistral Smallで4.5GB)が標準。Q2は30%高速だが品質10%低下。Q8は避ける — VRAMコスト2倍で効果は最小限。

CPU専用推論を高速化する方法

  • AVX-512を有効化: CPUが対応していれば`LLAMACPP_AVX512=1 ollama run phi`を使用。約20%高速化。
  • コンテキストウィンドウを縮小: 短いコンテキスト = 高速。4096の代わりに`--ctx-size 1024`を使用。
  • **Ollamaの代わりにllama.cppを使用:** オーバーヘッドが少なくCPUでわずかに速い(約10%ゲイン)。
  • マルチスレッドを無効化: 直感に反するが、弱いCPUではシングルスレッドが速い(スレッドオーバーヘッドなし)。
  • iGPUにオフロード: 弱い統合GPUでもCPUより速い。`lspci`でGPU利用可能性を確認。

実際のベンチマーク(2026年7月)

ハードウェア階層別の実測値、2026年7月。すべてOllamaのデフォルト設定使用、チューニングなし。すべてCPU専用またはiGPU — 専用GPUなし:

  • RAM 4 GB、CPU専用(Intel N100ミニPC)+ Qwen3 1.7B Q4_K_M:25〜35トークン/秒。`ollama run qwen3:1.7b`
  • RAM 8 GB、CPU専用(Core i5-1235U)+ Phi-4-mini Q4_K_M:15〜22トークン/秒。`ollama run phi4-mini`
  • RAM 8 GB、CPU専用(Radeon iGPU搭載Ryzen 5 5600G)+ Qwen3 4B Q4_K_M:レイヤーオフロードで18〜25トークン/秒。
  • RAM 8 GB + Intel Iris Xe(第12世代i5)+ Qwen3 4B Q4_K_M:12〜18トークン/秒。`ollama run qwen3:4b`
  • RAM 16 GB、CPU専用(Ryzen 7 7700X)+ Qwen3 8B Q4_K_M:8〜13トークン/秒。`ollama run qwen3:8b`
  • RAM 16 GB + iGPU Iris Xe + Llama 3.2 3B Q4_K_M:20〜30トークン/秒。`ollama run llama3.2:3b`

ローカルLLMで実際に「速い」とは?

速度の感じ方はタスクによって異なります — 次を参考にしてください:

モデルが15トークン/秒を下回る場合は、新しいハードウェアを購入する前にモデルサイズを縮小(7B → 3B)するか、量子化レベルを一段下げてください(Q5 → Q4)。

  • 10トークン/秒未満 → 壊れているように感じる。 単語が一つずつ、目立つ間隔をあけて表示されます。インタラクティブなチャットには使用不可。
  • 15〜25トークン/秒 → 許容範囲。 ほとんどのユーザーにとって読みやすい速度。Q&A、要約、コーディング支援に適しています。
  • 30トークン/秒以上 → スムーズ。 本物のアシスタントのように感じられます。すべてのインタラクティブなタスクに快適。
  • 60トークン/秒以上 → 瞬時。 読むより速い。リアルタイムのオートコンプリートや高速なイテレーションに最適。
ローカルLLMの速度体感の閾値:10トークン/秒未満は壊れているように感じる、15〜25トークン/秒はQ&Aに許容範囲、30トークン/秒以上はすべてのタスクでスムーズ、60トークン/秒以上でリアルタイムのオートコンプリートが可能。
ローカルLLMの速度体感の閾値:10トークン/秒未満は壊れているように感じる、15〜25トークン/秒はQ&Aに許容範囲、30トークン/秒以上はすべてのタスクでスムーズ、60トークン/秒以上でリアルタイムのオートコンプリートが可能。

低スペックPCで避けること

  • 13B+モデルは実行しない — RAMの限界を超えます。 Q4の13Bモデルは8〜10GB VRAMが必要で、実用的な低スペックPCの容量を超えます。積極的なQ2量子化でも13Bモデルは5〜6GBが必要で、OSとGPUスケジューリングのオーバーヘッドに十分な余裕がありません。7B以下を使用してください。
  • Q8量子化は避ける — 品質向上が最小限で遅い。 Q8はQ4の約2倍のVRAMを使用(Mistral Smallで8GB vs 5.5GB)し、品質向上はわずか約2%。4GBシステムではQ8は非実用的;8GBシステムではQ4が最適。Q4でOOMが発生する場合のみQ3を検討。
  • リアルタイムオートコンプリートは期待しない。 CPU上の3トークン/秒では50トークン生成に16秒かかります。インタラクティブなオートコンプリートには≥20トークン/秒が必要。低スペックCPU上のローカルLLMはバッチチャット、下書き、レビューに適しています — ライブオートコンプリートやコードタイプには不向きです。
  • CPU専用推論を本番チャットボットに使用しない。 内部ツール、プロトタイプ、オフラインバッチ作業には許容範囲。クラウドAPI(15〜20msレイテンシ)は低スペックCPU(300ms+レイテンシ)よりユーザー向けサービスに優れます。プライバシー重視またはオフラインシナリオには適していますが、速度重視には不向きです。

よくある間違い

  • 間違い:CPU速度のためにTinyLlamaを選択。 問題:TinyLlamaは4GB VRAM向けであり、CPU向けではありません — Phi-4-mini 3.8BはCPU専用ハードウェアでより速く、はるかに優れています。解決策:Phi-4-mini 3.8BをCPUで実行;TinyLlama Q5は4GB VRAM用に温存。
  • 間違い:CPU高速化フラグを有効化しない。 問題:AVX/NEONの欠如でコスト0で20%の速度向上を逃す。解決策:Ollama起動前に`LLAMACPP_AVX512=1`または`LLAMACPP_NEON=1`を設定。
  • 間違い:7Bを4GBに収めるためにQ2を強制。 問題:Q2量子化は推論中のKVキャッシュオーバーヘッドによりOOMクラッシュを起こしやすい。解決策:代わりにQ4の3Bモデルを使用。
  • 間違い:新しいハードウェアが常に速い推論を意味すると仮定。 問題:デスクトップRyzenはメモリ最適化の欠如によりモバイルARMより速くない場合があります。解決策:実際のハードウェアでベンチマーク。
  • 間違い:モデルに誤ったOllama slugを使用。 問題:`ollama run phi`はPhi-4-miniではなくPhi-2をロードします。解決策:最新のPhiモデルには`ollama run phi4-mini`を使用。常にollama.com/libraryで正確なモデルタグを確認してください。

低スペックPCのローカルLLM:地域別コンテキスト

日本(METI AIガバナンス): 経済産業省(METI)のAIガバナンスガイドラインはデータ最小化を推進します。低スペックハードウェアでのCPU推論は最も厳格なデータ主権要件を満たします — APIコールなし、ロギングなし、第三者データアクセスなし。日本語タスク向けにCPU上でQwen3を実行しているユーザーの場合、時間に余裕のある文書要約には1〜3トークン/秒のスループットで十分です。

EU / GDPR: 低スペックハードウェアでのローカル実行では、推論データが端末を離れません — 多くの中小企業やフリーランサーにとって、GDPR第44条の移転リスクを回避する技術的にシンプルな方法です。EU AI法(2025年2月施行)は個人利用の推論に文書化義務を課していません。データ保護の全体的なコンプライアンスは推論アーキテクチャだけでなく、運用全体に依存します。

中国: 消費者向けハードウェアでのローカル推論は、非中国製モデルへのクラウドAPIアクセスが制限されている中国において、Qwen3やDeepSeek-R1のデプロイでよく見られます。Qwen3 1.7Bと4BはCPU専用ハードウェアで動作し、ハードウェアが限られたユーザーにクラウドAPIの実用的な代替手段を提供します。

低スペックPCでのローカルLLM実行に関するよくある質問

低スペックPCでのローカルLLMとは何ですか?

低スペックPCでのローカルLLMとは、専用GPUのないCPU専用マシンで、システムRAMが4〜16 GBのものです。Intel IrisやAMD Radeon統合グラフィックスを搭載するほとんどのノートPC、専用GPUのない古いデスクトップPC、Intel N100などのミニPCが該当します。重要な制約はCPU速度ではなく、モデルの重みを保持するためのシステムRAMです。

GPUなしで7Bクラスのモデルを実行できますか?

はい — Qwen3 8B(Q4_K_M)はRAM 16 GB、CPU専用で8〜15トークン/秒で動作します(Ryzen 7 7700Xでテスト済み)。より小さいモデルより遅いですが、品質は明らかに優れています。RAM 8 GBの場合はPhi-4-mini(3.8B)を使用してください — 8Bモデル(Q4_K_M)は8 GBシステムでは確実に確保できない余裕を必要とします。

CPU推論はチャットボットに使用できますか?

はい、適切なモデルサイズを選べばインタラクティブ用途にも使えます。Phi-4-mini(15〜25トークン/秒、RAM 8 GB)とQwen3 1.7B(25〜40トークン/秒、RAM 4 GB)はどちらもリアルタイムチャットに十分な速度です。CPU上の7Bクラスモデル(8〜15トークン/秒)はライブの会話よりも、下書き、要約、オフラインレビューなどのバッチタスクに向いています。

CPU専用ハードウェアではPhi-4-miniとQwen3 1.7Bのどちらを使うべきですか?

RAM 8 GBがあればPhi-4-mini(3.8B)を使用 — コーディングと推論を15〜25トークン/秒で処理します。RAM 4 GBしかない、または最速の応答(25〜40トークン/秒)を優先する場合はQwen3 1.7Bを使用 — ただし複雑なタスクでは品質が多少犠牲になります。

GPUがあるかどうかはどう確認しますか?

NVIDIA専用GPUの場合はターミナルで`nvidia-smi`を実行。「command not found」が返る場合は、`lspci`(Linux)またはデバイスマネージャー(Windows)でIntel Iris XeまたはAMD RadeonのiGPUを確認してください — CUDA非対応でも一部のレイヤーをオフロードできます。

量子化は推論速度にどう影響しますか?

量子化は主に計算ではなくメモリ帯域幅要件を削減します。Q2(2ビット)はQ4(4ビット)より約30%速い:モデルが各フォワードパスでロードするバイト数が少ないためです。ただしQ2は約10%の品質ペナルティがあります。実用的なルール:本ガイドのすべての階層でデフォルトはQ4_K_M、RAMに収まらない場合のみQ3に切り替え。

Q2以下の量子化は可能ですか?

技術的にはQ1も可能ですが、品質は壊滅的に劣化 — 精度損失は最大30%。本ガイドのRAM 4GB階層を含め、実用的なユースケースには推奨しません。

CPU + iGPUハイブリッド推論はサポートされていますか?

はい、レイヤーオフロードを通じて対応。Intel Iris Xe iGPU搭載のRAM 8GBシステムでは、Qwen3 4Bが部分オフロードで12〜20トークン/秒に達し、CPU専用を上回ります。`OLLAMA_NUM_GPU=1`を設定すると、Ollamaが収まるレイヤーを自動的にオフロードします。

低スペックPC向け最速のローカルLLMは何ですか?

Qwen3 1.7B(Q4_K_M)は本ガイドで最速のモデルです — 最新のi5/Ryzen 5、RAM 4 GB、GPUなしで25〜40トークン/秒。同程度の速度でより高い品質が欲しい場合は、Phi-4-mini(3.8B)がRAM 8 GBで15〜25トークン/秒、コーディングと推論をより優れて処理します。

4GBのRAMでローカルLLMを実行できますか?

はい — Qwen3 1.7B(Q4_K_M)はRAM 4 GB・CPU専用向けの推奨モデルで、最新のi5/Ryzen 5で25〜40トークン/秒に到達します。本ガイドで最速のモデルであり、OS用の余裕を残して収まります。

速度にGPUは必要ですか?

いいえ — 本ガイドのすべてのモデルはCPU専用で動作します。Intel Iris iGPUは明確な速度向上をもたらします(Qwen3 4B:部分オフロードで12〜20トークン/秒 vs. CPU専用)が、あくまでオプションです。中古のRTX 4060 8GBなどの専用GPUはどのCPU構成よりも5〜10倍高速ですが、これは別のアップグレード経路であり、必須ではありません。

情報源

サードパーティの情報に関する注意

この記事はサードパーティのAIモデル、ベンチマーク、価格、ライセンスを参照しています。AIの状況は急速に変化しています。ベンチマークスコア、ライセンス条件、モデル名、API価格は執筆時とお読みになる時の間で変わる可能性があります。この記事に基づいてデプロイやコンプライアンスに関する決定を下す前に、各プロバイダーの公式ソース(ライセンスとベンチマークはHugging Faceのモデルカード、API価格はプロバイダーのウェブサイト、現在のGDPRとEU AI法のテキストはEUR-Lex)で最新の数値を確認してください。この記事は2026年5月時点で公開されている情報を反映しています。

ローカルLLM、独自のAPIキー、またはその両方でPromptQuorumを使用できます — バックエンドはあなたが選択します。

PromptQuorumベータ版をダウンロード →

← ローカルLLMに戻る