Skip to main content
PromptQuorum
ホーム/ローカルLLM活用/DeepSeekをオフライン実行 2026:プライベートなセルフホストDeepSeekに最適なハードウェア
Overview & Reference

DeepSeekをオフライン実行 2026:プライベートなセルフホストDeepSeekに最適なハードウェア

·13分で読める·Hans Kuepper 著 · PromptQuorumの創設者、マルチモデルAIディスパッチツール · PromptQuorum

DeepSeekを完全オフラインで実行するには、オープンウェイトのDeepSeek-R1 distillをダウンロードし、自分が管理するハードウェア上でOllamaまたはLM Studioで動かし、ネットワークアクセスをブロックします。APIなし、ファイアウォール回避なし、マシン外へのデータ流出なしです。 PromptQuorumの推奨は、現行の仕様と価格(2026年8月25日確認)に基づくもので、実機での検証結果ではありません。16 GB GPUでの14Bが最良のコストパフォーマンスの入口、24 GB GPUでの32Bが最強の単一GPU選択肢、中国語作業にはLlamaベースよりQwen2.5ベースのdistillを推奨します。セッション中の送信トラフィックを監視して「オフライン」を検証してください。また、ローカルが必ずしもAPIより安いとは限りません。どれだけ支出するかによります。→ ローカルLLM向けの最適GPU購入ガイドを見る

DeepSeekの推論モデルを完全オフラインで実行します。APIなし、グレートファイアウォールへの依存なし、データを完全にコントロールできます。本ガイドでは、VRAMと用途に応じたDeepSeek distillの選び方、現実的なハードウェアクラス(NVIDIA GPU、Apple Silicon、mini PC、クラウドレンタル)、OllamaとLM Studioでのオフラインセットアップ、そしてデプロイが本当にオフラインであることの検証方法を扱います。ネットワークとファイアウォールの仕組みは別記事にリンクし、重複させません。(DeepSeekはその後、ホスト型APIの新世代としてDeepSeek-V4—Flash/Pro—をリリースしました。R1/V3は引き続き、セルフホスト可能なオープンウェイトモデルです。)

このページには参考用の第三者製品へのリンクが含まれています。PromptQuorumはいかなるアフィリエイトプログラムにも参加しておらず、これらはコミッションを得ない単なる参照リンクです。リンクのクリックと次のステップはご自身の責任です。これらのリンクはPromptQuorumによる推奨や検証を表すものではありません。

DeepSeekをオフライン実行 2026:プライベートなセルフホストDeepSeekに最適なハードウェア

重要なポイント

  • DeepSeek-R1 distillがネットワークを必要とするのは一度だけ(ダウンロード時)です。推論時は完全オフラインで動きます。
  • 中国語推論では、Qwen2.5ベースのdistill(1.5B/7B/14B/32B)がLlama 3ベースの8B/70Bより中国語を得意とします。
  • ハードウェアをモデルに合わせる:16 GB → 14B、24 GB → 32B;GPUごとの完全な対応はBiteリファレンスにあります。
  • ここでのセットアップはモデル側のみ。OllamaまたはLM Studio。ネットワーク/ファイアウォールの仕組みは重複回避のためリンクで案内します。
  • 「オフライン」を実証的に検証:ネットワークを遮断するか、セッション中の送信トラフィックを監視して送信ゼロを確認します。
  • オフラインのセルフホストはグレートファイアウォールへの依存がなく、国境を越えるデータフローもありません。
  • すべてのdistillをtemperature 0.6、システムプロンプトなしで実行します。

なぜDeepSeekをオフラインで実行するのか?

DeepSeekをオフラインで実行すると、完全なデータ管理が得られ、ホスト型APIやネットワーク状況への依存がなくなります。モデルはローカルハードウェアから回答し、マシン外へ何も出ません。 主権が重視される作業では、これは「自分が管理するツール」と「依存するサービス」の違いです。

主な動機は4つあります。データ主権(プロンプトと出力が環境外に出ない)、ハードウェア購入後は追加のトークン課金が発生しないこと、ネットワーク制限からの独立(グレートファイアウォールの背後にいるユーザーにとって具体的です。オフラインモデルには到達すべき海外エンドポイントがないため)、そして信頼性(ホスト型エンドポイントの障害やレート制限がない)です。いずれも「自動的に安くなる」という意味ではありません。詳細は下記のコスト比較を参照してください。

これはローカルDeepSeekは中国のデータ問題を解決するか?のプライバシー分析の実践的な対になります。あちらのページはローカルのセルフホストがなぜデータフローの懸念を取り除くかを説明し、こちらはその構築方法と買うべきハードウェアを示します。

📍 一文で説明

DeepSeekをオフラインで実行すると、すべてのプロンプトと出力がローカルハードウェアにとどまり、ホスト型APIへの依存とあらゆるネットワーク制限がなくなります。

💬 簡潔に説明

オフラインモデルは、訪れるウェブサイトに対して、自分が所有する本のようなものです。一度棚に並べば、読むのにインターネットも誰かの許可も要りません。

ホスト型API対オフライン自己ホストDeepSeek:クラウドAPIはプロンプトを海外エンドポイントへ送りネットワーク稼働に依存する一方、オフライン自己ホストはすべてのプロンプトと出力をローカルハードウェアにとどめ、マシン外へ何も出しません。
ホスト型API対オフライン自己ホストDeepSeek:クラウドAPIはプロンプトを海外エンドポイントへ送りネットワーク稼働に依存する一方、オフライン自己ホストはすべてのプロンプトと出力をローカルハードウェアにとどめ、マシン外へ何も出しません。

ローカルDeepSeek対DeepSeek API

ローカルが安いと決めつけないでください。DeepSeekのホスト型API価格は非常に低く、セルフホストの本当の理由はプライバシー・コントロール・オフライン運用であって、確実な節約ではありません。 2026年8月25日時点(DeepSeek公式のAPI価格ページで確認済み)、DeepSeek-V4 Flashは入力100万トークンあたり$0.007/$0.22(キャッシュヒット/ミス、オフピーク)、出力は100万トークンあたりオフピークで$0.66です。DeepSeek-V4 Proは入力$0.022/$0.66、出力オフピーク$1.98で、平日ピーク時間帯(UTC 01:00–04:00および06:00–10:00)にはおおむね倍になります。この価格では、利用が軽い、あるいは断続的なユーザーは、ハードウェアが元を取るまでの長い間、API利用料をごくわずかしか支払わずに済みます。

損益分岐点の計算は、利用量に完全に依存します。毎日の大量利用(月間数百万トークン規模)は数か月でハードウェアに天秤が傾きます。断続的・バースト的な利用では元が取れないこともあります。PromptQuorumのローカルAIコスト計算機に自分の想定月間支出を入力し、勘ではなく実際の数字を出してください。

要因
DeepSeek API
ローカルDeepSeek
ハードウェアなし階層により$400〜2,800以上(予算セクション参照)
インターネット必須モデルダウンロード後は不要
トークン単価あり(上記参照)継続的なAPI費用なし
プライバシープロンプトはホスト型エンドポイントへ送信マシン外へ何も出ない
保守なしハードウェアとソフトウェアスタックを自分で管理
モデルコントロールホスト型、ベンダー管理自分で管理、任意のdistillを選択可能
オフライン対応不可一度ダウンロードすれば可能
向いている用途断続的な利用、利便性重視毎日・大量の利用、プライバシー、データ主権

セルフホストの本当の理由はプライバシー+独立性+コントロールであり、自動的なコスト削減ではありません。DeepSeekを断続的にしか使わないなら、APIの方がほぼ確実に安くシンプルです。

中国語推論にはどのDeepSeek distillが最適か?

中国語推論には、Qwen2.5ベースのDeepSeek-R1 distill(7B、14B、または32B)を選びます。Qwen2.5は中国語カバレッジが強く訓練されているため、これらのdistillはLlama 3ベースの8Bや70Bより中国語のプロンプトと出力を明らかに得意とします。 推論の挙動はdistill間で同じで、言語品質を決めるのはベースモデルです。

中国語ワークロード向けの実用的な選択:16 GBカード上の14Bがバランスの取れた既定値で、24 GBカード上の32Bが最強の単一GPUオプションです。どちらもQwen2.5ベースのおかげで中国語を流暢に推論します。Llamaベースのdistillは、英語中心の作業やLlamaライセンス要件のために取っておきます。

本セクションが応えるヘッドクエリ:本地部署 deepseek(DeepSeekをローカル展開)、deepseek 离线(DeepSeekオフライン)、deepseek 私有化部署(DeepSeekのプライベート展開)。3つすべての答えは同じです。OllamaまたはLM Studioでローカル実行するQwen2.5ベースのdistillです。

📍 一文で説明

中国語推論には、Qwen2.5ベースのDeepSeek-R1 distill(7B/14B/32B)を選びます。QwenベースはLlamaベースのdistillより中国語をはるかに得意とします。

どのモデルを実行すべきか、どれだけのVRAMが必要か?

distillをVRAMと用途に合わせます。どのDeepSeek-R1デプロイとも同じ階層に、各階層が実際に向いている用途を加えたものです。これは簡略版で、2つのBiteリファレンスにGPUごとの完全な表とquantごとのVRAMがあります。

  • PromptQuorumの見解: 大半の人には14Bまたは32Bが最適解です。70Bへの飛躍は本当に別のハードウェアカテゴリー(デュアルGPU、大容量メモリのワークステーション、本格的な冷却と電源)であり、32Bからの自然な延長ではなく、独立した購入判断として扱ってください。
  • フルの671Bモデルは一般的なコンシューマーPCの対象ではありません。その規模の作業が必要なら、部品を個別に組み立てるのではなく、専用のAIワークステーション構成をクラウド/API費用と比較検討してください。ローカルAIワークステーション構築ガイドを参照してください。
VRAM
最適なdistill(オフライン)
総評
向いている用途
8 GB7B または R1-0528-Qwen3-8B良い入口ノートPC、廉価GPU、小型サーバー、実験
16 GB14B (Qwen2.5)最良のコスパほとんどの本格利用者。バランス型の既定、中国語に強い
24 GB32B (Qwen2.5)最良の単一GPUマルチGPUなしで本格的な一段上を求める愛好家
48 GB+/デュアルGPU70B (Llama 3)本格ワークステーション領域プロフェッショナル向け。Qwenのdistillより中国語出力は弱め
約400 GB+フルDeepSeek-R1(671B)一般的なコンシューマー用途ではないエンタープライズ級マルチGPUクラスタ専用。mini PCで動くと期待しないこと

常時稼働で低消費電力のオフラインエンドポイントには、能力のあるmini PCが7Bと14Bのdistillを静かに実行します。ローカルLLM向けの最適mini PCを参照してください。正確なGPU対応は関連ガイドのBiteリファレンスを参照してください。

ローカルDeepSeek向けの最適なハードウェアクラス

単一の製品紹介ではなく、現実的な4つのハードウェア経路を挙げます。優先事項に合うものを選び、正確な現行の選択肢と価格は専用ガイドを使ってください。

  • NVIDIA GPU。最大の性能と互換性に最適。 既定の選択肢です。最も幅広いソフトウェア対応(Ollama、vLLM、llama.cppはいずれもCUDA上で快適に動く)、16 GB/24 GB階層で最もVRAM単価が良い選択肢の多さ、そしてほとんどのローカルLLMツールがNVIDIA向けに先に開発されるためトラブルシューティングも最も簡単です。現行の選択肢はローカルLLM向けの最適GPU購入ガイドを参照してください。
  • AMD GPU。ROCmエコシステムを扱う覚悟がある人に最適。 VRAM単価が良い可能性がありますが、購入前に自分が使う正確なランタイム(Ollama、llama.cpp)でのROCm/ソフトウェア互換性を確認してください。対応範囲はNVIDIAより狭く、カード世代によって差があります。
  • Apple Silicon。静かで低消費電力、大容量の統合メモリを求める人に最適。 利点は従来型のGPU VRAMではなく、共有メモリ容量です。十分な統合RAMを積んだMacは、同価格帯のディスクリートGPUよりも大きなdistillを、消費電力のごく一部で読み込めます。ローカルAI向けの最適Macを参照してください。
  • mini PC。常時稼働のローカルAIサーバーに最適。 ワークロードが7B、一部の14B、Home Assistant連携、RAG、あるいはバックグラウンドのローカルアシスタントであり、最大推論速度を求めていないなら適切な選択です。ローカルLLM向けの最適mini PCを参照してください。
  • クラウドGPUレンタル。購入前に階層を試したい、あるいは一時的なバーストキャパシティが必要な場合に最適。 「オフライン」ではありませんが、ハードウェアを購入する前に32B/70B級の性能を試す正当な方法です。クラウドGPUレンタルガイドを参照してください。

DeepSeekをオフラインでどう設定するか?

オフラインセットアップはモデル側のみです。一度ダウンロードし、その後ネットワークなしで実行します。以下はOllamaでの手順です(LM StudioはGUI版で、モデルをプルしてからオフラインにします)。

  1. 1
    OllamaまたはLM Studioをインストール
    Why it matters: これらは推論時に外部依存なくモデルをローカル実行します。オンラインで一度インストールします。
  2. 2
    distillを一度プル
    Why it matters: 接続状態で`ollama run deepseek-r1:14b`(または該当階層)を実行します。ネットワークが必要なのはこの手順だけです。
  3. 3
    ネットワークを切断またはブロック
    Why it matters: モデルがキャッシュされたら、ネットワークアクセスを遮断します。モデルはローカルの重みだけで回答を提供します。
  4. 4
    temperatureを0.6に設定し、システムプロンプトをクリア
    Why it matters: R1の繰り返し障害モードを防ぎます。すべての指示はユーザープロンプトに入れます。
  5. 5
    オフラインで推論を実行
    Why it matters: すべてのプロンプトと出力が送信なしでマシン内にとどまります。下の検証手順で確認します。
bash
ollama pull deepseek-r1:14b    # 一度だけ、オンライン
# その後ネットワークを切断 / ブロック
ollama run deepseek-r1:14b     # 完全オフライン推論
DeepSeekをオフライン実行する5ステップ:OllamaまたはLM Studioをインストールし、オンラインでdistillを一度プルし、ネットワークアクセスを遮断し、temperature 0.6・システムプロンプトなしに設定し、完全オフラインで推論を実行します。
DeepSeekをオフライン実行する5ステップ:OllamaまたはLM Studioをインストールし、オンラインでdistillを一度プルし、ネットワークアクセスを遮断し、temperature 0.6・システムプロンプトなしに設定し、完全オフラインで推論を実行します。

ネットワークとファイアウォールの仕組みは?

オフラインモデル自体はファイアウォール設定、VPN、ネットワークトンネリングを必要としません。到達すべき海外エンドポイントがないためです。よって唯一のネットワーク作業は、マシン上の他のものが外部通信しないようにすることだけです。 その一般的なトピック(ファイアウォールルール、エアギャップ、送信接続のブロック)は別の場所で詳しく扱い、ここでは重複させません。

ファイアウォールとオフラインネットワークの完全なセットアップ(ワークステーションのエアギャップ化や送信トラフィックのロックダウンを含む)はファイアウォール越しのローカルAI:オフライン 2026を参照してください。本記事はDeepSeekのモデル選定とオフラインモデルのセットアップを扱い、あちらはネットワークの仕組みを扱います。

本当にオフラインかをどう検証するか?

オフライン状態を実証的に証明します。送信トラフィックを監視するかネットワークを無効にした状態で完全な推論セッションを実行し、モデルプロセスからの送信接続がゼロであることを確認します。 推測せず実証してください。それが主権の主張を監査可能にするものだからです。

簡単な方法は2つあります。ネットワークアダプターを無効化(またはケーブルを抜く)して推論がなお動くことを確認する方法。これはモデルが接続性を必要としない証拠になります。あるいはネットワークは有効のまま、パケットキャプチャやプロセス別ファイアウォールで送信接続を監視し、セッション中にOllama/LM Studioプロセスが1つも開かないことを確認する方法です。

設定のコツ:temperature 0.6、システムプロンプトなし

temperatureを0.6に設定し(0.5–0.7が安全)、システムプロンプトを使わず、すべての指示をユーザープロンプトに入れます。 これはDeepSeek-R1 distillが陥りやすい繰り返しと非整合の障害モードを回避し、オフラインでもオンラインと同じくらい重要です。

ハードウェアを買うかAPIを使うか?

これが本当の判断であり、DeepSeekをどれだけ実際に使うかに左右されます。抽象的にどちらが「優れているか」ではありません。

  • ハードウェアを買うべき場合: DeepSeekを毎日使う、業務上プライバシーが重要、オフライン運用が必要、同じマシンで複数のローカルサービスを動かす予定がある、すでに適したハードウェアを持っている、あるいはベンダーの価格変更に左右されない長期的で予測可能なアクセスを望む場合です。
  • APIを使うべき場合: DeepSeekを断続的にしか使わない、ハードウェアやソフトウェアスタックを維持したくない、エンタープライズ級GPUを買わずに最大の推論速度が欲しい、あるいはオフライン運用が自分の用途では実質的に重要でない場合です。
  • DeepSeekの現行API価格(上記で確認済み)は非常に低く、断続的な利用者はコスト節約目的でハードウェアを買うより、単純にAPI利用料を払う方がほぼ確実に得です。ハードウェアの意義はプライバシーとコントロールであって、確実な節約ではありません。
  • 決める前にローカルAIコスト計算機で自分の数字を計算してください。想定月間API支出とハードウェア価格を入れれば、経験則ではなく実際の損益分岐点の見積もりが得られます。

予算階層別ハードウェア

2026年の重要な背景:メモリ市場の圧力によりGPUとVRAMの価格はこの1年で大幅に上昇しました。2025年に約$1,000〜1,300だった中古の24 GBカードは、2026年8月時点では約$2,200〜2,800で取引されています。 昨年の価格がそのまま通用すると考えず、予算を見直してください。入門の16 GB階層は比較的安定しています。日本円ベースでは為替や国内小売価格により変動するため、正確な換算は行わず米ドル表示のままとしています。

予算
目標
備考
$500未満DeepSeek 7B、小規模な14Bワークロード中古または入門GPUシステム
$500〜900ローカルDeepSeek 14B16 GB GPU。初心者向けの最適解で、価格は比較的安定
$1,500〜3,000DeepSeek 32B24 GB GPU。この階層は2026年に大幅値上がり。購入前に現行価格を確認
$3,000以上本格的なローカルAI、拡張余地あり24 GB+ GPU、64〜128 GB RAM、複数のNVMeドライブ
$5,000以上70B以上のモデルこの予算帯では専用AIワークステーション構成をクラウド/API費用と比較。ワークステーション構築ガイドを参照
24GB+ NVIDIAシステムを見る →製品リンク · 開示済みクラウド/API費用と比較 →製品リンク · 開示済み

買うべきでないもの

「これを買えばいい」しか言わないページはセールスページに見えてしまうため、よくある失敗をはっきり挙げておく価値があります。

  • 7Bモデルを動かすためだけに$2,000以上のGPUシステムを買わないこと。入門階層ですでに十分対応できる無駄な出費です。
  • 実際に必要とするワークロードなしに128 GBのシステムRAMを買わないこと。GPU推論での本当のボトルネックは通常システムRAMではなくVRAMです。
  • スペック表が魅力的に見えるという理由だけでAMD GPUを買わないこと。まず自分が使う正確なランタイムでのROCm/ソフトウェア互換性を確認してください。
  • 高速な70Bやフル671B推論を期待してmini PCを買わないこと。その規模でのメモリと演算の要件はまったく別のハードウェアクラスです。
  • 計算せずにローカルの方が安いと決めつけないこと。断続的な利用者はAPIの方がほぼ確実に向いています(上記のコスト比較を参照)。

よくある質問

DeepSeekは完全オフラインで動きますか?

はい。distillをダウンロードすれば、ネットワークを無効化した状態でも推論を続けられます。ネットワークを切断・完全ブロックしてもローカルの重みから動作し続けます。

DeepSeek-R1を中国で使うのにVPNは必要ですか?

モデルをローカルで実行する場合は不要です。オフラインモデルには到達すべき海外エンドポイントがないため、VPNやファイアウォール回避は推論に無関係です。唯一のネットワーク作業は、マシン上の他のものがデータを外部送信しないようにすることです。

中国語にはどのDeepSeek distillが最適ですか?

Qwen2.5ベースのdistill(7B、14B、または32B)です。Qwen2.5は中国語カバレッジが強いため、Llama 3ベースの8Bや70B distillより中国語のプロンプトと出力を得意とします。

DeepSeek 32Bにはどれだけのvramが必要ですか?

24 GBのGPUが量子化された32B構成の実用的な目安です。量子化とランタイムによって変わります。詳しい階層内訳は上記の「どのモデルを、どれだけのVRAMで?」の表を参照してください。

mini PCでDeepSeekを動かせますか?

はい。特に7B distillと一部の14B構成で動きます。mini PCは常時稼働・低消費電力のエンドポイントに適した選択肢ですが、DeepSeekの最大性能や70B以上のモデルには一般的に向いていません。

Apple SiliconでDeepSeekを動かせますか?

はい。大容量の統合メモリを持つApple Siliconシステムは、ローカルLLMの実験にとりわけ興味深い選択肢になり得ます。利点が従来型のGPU VRAMではなく共有メモリ容量にあるためです。上記の「最適なハードウェアクラス」セクションを参照してください。

ローカルDeepSeekはAPIより安いですか?

必ずしもそうではありません。ハードウェアには相当な初期費用がかかり、DeepSeekの現行API価格は低いです。ローカル展開の最大の利点はプライバシー・コントロール・オフライン運用であり、確実なコスト節約ではありません。リンク先のコスト計算機で自分の数字を計算してください。

オフラインモデルがどこにもデータを送っていないとどう確認しますか?

セッション中の送信トラフィックを監視するか、ネットワークを完全に無効化して推論がなお動くことを確認します。ローカルに読み込んだモデルは推論のためにDeepSeek APIへの接続を本質的には必要としませんが、思い込みではなく自分のデプロイで実際に検証すべきです。

DeepSeekのオフライン実行に向いているハードウェアは何ですか?

16 GBのGPUは14B distillを、24 GBのGPUは32Bを動かします。静かな常時稼働エンドポイントには、能力のあるmini PCが7Bと14Bを扱います。正確な対応はGPUおよびVRAMのBiteを参照し、NVIDIA/AMD/Apple Silicon/mini PCのトレードオフは「最適なハードウェアクラス」セクションを参照してください。

フルのDeepSeek-R1をオフラインで動かせますか?

コンシューマー向けハードウェアでは無理です。フルの671B R1はQ4レベルの量子化で約400 GB以上のVRAMを必要とします。オフラインのセルフホストでは、現実的にはローカルGPUで動くdistill(1.5B〜70B)を使います。

ファイアウォールとネットワークの手順はどこにありますか?

本ガイドはファイアウォールとエアギャップの仕組みを意図的に再説明しません。完全なネットワークロックダウンは「ファイアウォール越しのローカルAI:オフライン 2026」を参照してください。ここではDeepSeekのモデル選定、ハードウェア、オフラインモデルのセットアップを扱います。

オフラインDeepSeekにはどの設定を使うべきですか?

temperature 0.6、システムプロンプトなし、指示はユーザーメッセージに入れます。これは標準のDeepSeek-R1設定で、繰り返し障害モードを防ぎます。

更新ログ

  • 2026-08-25にアフィリエイトページとして全面刷新:ハードウェアクラス別の内訳(NVIDIA/AMD/Apple Silicon/mini PC/クラウド)、推奨構成の目標、検証済みのDeepSeek API価格比較、購入対API判断のセクション、修正済みの2026年ハードウェア予算表(GPU/VRAM価格は前年比で大幅上昇)、そして「買うべきでないもの」セクションを追加しました。「DeepSeekのオープンウェイトにはテレメトリがない」という過大な主張を修正し、デプロイごとに実証的に検証すべきという表現に改めました。
  • 2026-06-19公開。次回レビュー予定は2026-09-25(月次フレッシュネス階層、GPU/API価格の急速な変動を反映)。
  • DeepSeekのオフラインモデル選定、中国語モデルの選択、ハードウェアクラスの選択、オフラインモデルのセットアップを扱います。ネットワーク/ファイアウォールの仕組みは意図的にリンクで案内。DeepSeek自体のAPIではなく、DeepSeekを取り巻くハードウェアインフラ(GPU/Mac/mini PC/ワークステーションガイド)を収益化します。

← ローカルLLM活用 に戻る