重要なポイント
- DeepSeek-R1 distillがネットワークを必要とするのは一度だけ(ダウンロード時)です。推論時は完全オフラインで動きます。
- 中国語推論では、Qwen2.5ベースのdistill(1.5B/7B/14B/32B)がLlama 3ベースの8B/70Bより中国語を得意とします。
- ハードウェアをモデルに合わせる:16 GB → 14B、24 GB → 32B;GPUごとの完全な対応はBiteリファレンスにあります。
- ここでのセットアップはモデル側のみ。OllamaまたはLM Studio。ネットワーク/ファイアウォールの仕組みは重複回避のためリンクで案内します。
- 「オフライン」を実証的に検証:ネットワークを遮断するか、セッション中の送信トラフィックを監視して送信ゼロを確認します。
- オフラインのセルフホストはグレートファイアウォールへの依存がなく、国境を越えるデータフローもありません。
- すべてのdistillをtemperature 0.6、システムプロンプトなしで実行します。
なぜDeepSeekをオフラインで実行するのか?
DeepSeekをオフラインで実行すると、完全なデータ管理が得られ、ホスト型APIやネットワーク状況への依存がなくなります。モデルはローカルハードウェアから回答し、マシン外へ何も出ません。 主権が重視される作業では、これは「自分が管理するツール」と「依存するサービス」の違いです。
主な動機は4つあります。データ主権(プロンプトと出力が環境外に出ない)、ハードウェア購入後は追加のトークン課金が発生しないこと、ネットワーク制限からの独立(グレートファイアウォールの背後にいるユーザーにとって具体的です。オフラインモデルには到達すべき海外エンドポイントがないため)、そして信頼性(ホスト型エンドポイントの障害やレート制限がない)です。いずれも「自動的に安くなる」という意味ではありません。詳細は下記のコスト比較を参照してください。
これはローカルDeepSeekは中国のデータ問題を解決するか?のプライバシー分析の実践的な対になります。あちらのページはローカルのセルフホストがなぜデータフローの懸念を取り除くかを説明し、こちらはその構築方法と買うべきハードウェアを示します。
📍 一文で説明
DeepSeekをオフラインで実行すると、すべてのプロンプトと出力がローカルハードウェアにとどまり、ホスト型APIへの依存とあらゆるネットワーク制限がなくなります。
💬 簡潔に説明
オフラインモデルは、訪れるウェブサイトに対して、自分が所有する本のようなものです。一度棚に並べば、読むのにインターネットも誰かの許可も要りません。
ローカルDeepSeek対DeepSeek API
ローカルが安いと決めつけないでください。DeepSeekのホスト型API価格は非常に低く、セルフホストの本当の理由はプライバシー・コントロール・オフライン運用であって、確実な節約ではありません。 2026年8月25日時点(DeepSeek公式のAPI価格ページで確認済み)、DeepSeek-V4 Flashは入力100万トークンあたり$0.007/$0.22(キャッシュヒット/ミス、オフピーク)、出力は100万トークンあたりオフピークで$0.66です。DeepSeek-V4 Proは入力$0.022/$0.66、出力オフピーク$1.98で、平日ピーク時間帯(UTC 01:00–04:00および06:00–10:00)にはおおむね倍になります。この価格では、利用が軽い、あるいは断続的なユーザーは、ハードウェアが元を取るまでの長い間、API利用料をごくわずかしか支払わずに済みます。
損益分岐点の計算は、利用量に完全に依存します。毎日の大量利用(月間数百万トークン規模)は数か月でハードウェアに天秤が傾きます。断続的・バースト的な利用では元が取れないこともあります。PromptQuorumのローカルAIコスト計算機に自分の想定月間支出を入力し、勘ではなく実際の数字を出してください。
要因 | DeepSeek API | ローカルDeepSeek |
|---|---|---|
| ハードウェア | なし | 階層により$400〜2,800以上(予算セクション参照) |
| インターネット | 必須 | モデルダウンロード後は不要 |
| トークン単価 | あり(上記参照) | 継続的なAPI費用なし |
| プライバシー | プロンプトはホスト型エンドポイントへ送信 | マシン外へ何も出ない |
| 保守 | なし | ハードウェアとソフトウェアスタックを自分で管理 |
| モデルコントロール | ホスト型、ベンダー管理 | 自分で管理、任意のdistillを選択可能 |
| オフライン対応 | 不可 | 一度ダウンロードすれば可能 |
| 向いている用途 | 断続的な利用、利便性重視 | 毎日・大量の利用、プライバシー、データ主権 |
セルフホストの本当の理由はプライバシー+独立性+コントロールであり、自動的なコスト削減ではありません。DeepSeekを断続的にしか使わないなら、APIの方がほぼ確実に安くシンプルです。
中国語推論にはどのDeepSeek distillが最適か?
中国語推論には、Qwen2.5ベースのDeepSeek-R1 distill(7B、14B、または32B)を選びます。Qwen2.5は中国語カバレッジが強く訓練されているため、これらのdistillはLlama 3ベースの8Bや70Bより中国語のプロンプトと出力を明らかに得意とします。 推論の挙動はdistill間で同じで、言語品質を決めるのはベースモデルです。
中国語ワークロード向けの実用的な選択:16 GBカード上の14Bがバランスの取れた既定値で、24 GBカード上の32Bが最強の単一GPUオプションです。どちらもQwen2.5ベースのおかげで中国語を流暢に推論します。Llamaベースのdistillは、英語中心の作業やLlamaライセンス要件のために取っておきます。
本セクションが応えるヘッドクエリ:本地部署 deepseek(DeepSeekをローカル展開)、deepseek 离线(DeepSeekオフライン)、deepseek 私有化部署(DeepSeekのプライベート展開)。3つすべての答えは同じです。OllamaまたはLM Studioでローカル実行するQwen2.5ベースのdistillです。
📍 一文で説明
中国語推論には、Qwen2.5ベースのDeepSeek-R1 distill(7B/14B/32B)を選びます。QwenベースはLlamaベースのdistillより中国語をはるかに得意とします。
どのモデルを実行すべきか、どれだけのVRAMが必要か?
distillをVRAMと用途に合わせます。どのDeepSeek-R1デプロイとも同じ階層に、各階層が実際に向いている用途を加えたものです。これは簡略版で、2つのBiteリファレンスにGPUごとの完全な表とquantごとのVRAMがあります。
- PromptQuorumの見解: 大半の人には14Bまたは32Bが最適解です。70Bへの飛躍は本当に別のハードウェアカテゴリー(デュアルGPU、大容量メモリのワークステーション、本格的な冷却と電源)であり、32Bからの自然な延長ではなく、独立した購入判断として扱ってください。
- フルの671Bモデルは一般的なコンシューマーPCの対象ではありません。その規模の作業が必要なら、部品を個別に組み立てるのではなく、専用のAIワークステーション構成をクラウド/API費用と比較検討してください。ローカルAIワークステーション構築ガイドを参照してください。
VRAM | 最適なdistill(オフライン) | 総評 | 向いている用途 |
|---|---|---|---|
| 8 GB | 7B または R1-0528-Qwen3-8B | 良い入口 | ノートPC、廉価GPU、小型サーバー、実験 |
| 16 GB | 14B (Qwen2.5) | 最良のコスパ | ほとんどの本格利用者。バランス型の既定、中国語に強い |
| 24 GB | 32B (Qwen2.5) | 最良の単一GPU | マルチGPUなしで本格的な一段上を求める愛好家 |
| 48 GB+/デュアルGPU | 70B (Llama 3) | 本格ワークステーション領域 | プロフェッショナル向け。Qwenのdistillより中国語出力は弱め |
| 約400 GB+ | フルDeepSeek-R1(671B) | 一般的なコンシューマー用途ではない | エンタープライズ級マルチGPUクラスタ専用。mini PCで動くと期待しないこと |
常時稼働で低消費電力のオフラインエンドポイントには、能力のあるmini PCが7Bと14Bのdistillを静かに実行します。ローカルLLM向けの最適mini PCを参照してください。正確なGPU対応は関連ガイドのBiteリファレンスを参照してください。
ローカルDeepSeek向けの最適なハードウェアクラス
単一の製品紹介ではなく、現実的な4つのハードウェア経路を挙げます。優先事項に合うものを選び、正確な現行の選択肢と価格は専用ガイドを使ってください。
- NVIDIA GPU。最大の性能と互換性に最適。 既定の選択肢です。最も幅広いソフトウェア対応(Ollama、vLLM、llama.cppはいずれもCUDA上で快適に動く)、16 GB/24 GB階層で最もVRAM単価が良い選択肢の多さ、そしてほとんどのローカルLLMツールがNVIDIA向けに先に開発されるためトラブルシューティングも最も簡単です。現行の選択肢はローカルLLM向けの最適GPU購入ガイドを参照してください。
- AMD GPU。ROCmエコシステムを扱う覚悟がある人に最適。 VRAM単価が良い可能性がありますが、購入前に自分が使う正確なランタイム(Ollama、llama.cpp)でのROCm/ソフトウェア互換性を確認してください。対応範囲はNVIDIAより狭く、カード世代によって差があります。
- Apple Silicon。静かで低消費電力、大容量の統合メモリを求める人に最適。 利点は従来型のGPU VRAMではなく、共有メモリ容量です。十分な統合RAMを積んだMacは、同価格帯のディスクリートGPUよりも大きなdistillを、消費電力のごく一部で読み込めます。ローカルAI向けの最適Macを参照してください。
- mini PC。常時稼働のローカルAIサーバーに最適。 ワークロードが7B、一部の14B、Home Assistant連携、RAG、あるいはバックグラウンドのローカルアシスタントであり、最大推論速度を求めていないなら適切な選択です。ローカルLLM向けの最適mini PCを参照してください。
- クラウドGPUレンタル。購入前に階層を試したい、あるいは一時的なバーストキャパシティが必要な場合に最適。 「オフライン」ではありませんが、ハードウェアを購入する前に32B/70B級の性能を試す正当な方法です。クラウドGPUレンタルガイドを参照してください。
推奨するローカルDeepSeek構成
マルチGPUに踏み込まずにローカル推論を本格的に一段引き上げたいPromptQuorum読者の大半には、24 GB GPU、システムRAM 64 GB、NVMeストレージ2 TBで、Ollama経由でDeepSeek-R1 32Bを動かす構成をおすすめします。 これは特定の製品ではなく構成の目標です。現行の選択肢と価格は下記のGPU購入ガイドを使ってください。
- この階層での現実的な用途:中国語推論、コーディング支援、文書分析、プライベートアシスタント、ローカル文書に対するRAG、ローカルエージェントの実験です。
- 予算が限られる場合は16 GB/14B階層に下げてください。上記のどのモデルを、どれだけのVRAMで?と、下記の予算内訳を参照してください。
コンポーネント | 目標スペック |
|---|---|
| GPU | 24 GB VRAM |
| システムRAM | 64 GB |
| ストレージ | 2 TB NVMe |
| ソフトウェア | Ollama |
| モデル | DeepSeek-R1-Distill-Qwen-32B |
DeepSeekをオフラインでどう設定するか?
オフラインセットアップはモデル側のみです。一度ダウンロードし、その後ネットワークなしで実行します。以下はOllamaでの手順です(LM StudioはGUI版で、モデルをプルしてからオフラインにします)。
- 1OllamaまたはLM Studioをインストール
Why it matters: これらは推論時に外部依存なくモデルをローカル実行します。オンラインで一度インストールします。 - 2distillを一度プル
Why it matters: 接続状態で`ollama run deepseek-r1:14b`(または該当階層)を実行します。ネットワークが必要なのはこの手順だけです。 - 3ネットワークを切断またはブロック
Why it matters: モデルがキャッシュされたら、ネットワークアクセスを遮断します。モデルはローカルの重みだけで回答を提供します。 - 4temperatureを0.6に設定し、システムプロンプトをクリア
Why it matters: R1の繰り返し障害モードを防ぎます。すべての指示はユーザープロンプトに入れます。 - 5オフラインで推論を実行
Why it matters: すべてのプロンプトと出力が送信なしでマシン内にとどまります。下の検証手順で確認します。
ollama pull deepseek-r1:14b # 一度だけ、オンライン
# その後ネットワークを切断 / ブロック
ollama run deepseek-r1:14b # 完全オフライン推論ネットワークとファイアウォールの仕組みは?
オフラインモデル自体はファイアウォール設定、VPN、ネットワークトンネリングを必要としません。到達すべき海外エンドポイントがないためです。よって唯一のネットワーク作業は、マシン上の他のものが外部通信しないようにすることだけです。 その一般的なトピック(ファイアウォールルール、エアギャップ、送信接続のブロック)は別の場所で詳しく扱い、ここでは重複させません。
ファイアウォールとオフラインネットワークの完全なセットアップ(ワークステーションのエアギャップ化や送信トラフィックのロックダウンを含む)はファイアウォール越しのローカルAI:オフライン 2026を参照してください。本記事はDeepSeekのモデル選定とオフラインモデルのセットアップを扱い、あちらはネットワークの仕組みを扱います。
本当にオフラインかをどう検証するか?
オフライン状態を実証的に証明します。送信トラフィックを監視するかネットワークを無効にした状態で完全な推論セッションを実行し、モデルプロセスからの送信接続がゼロであることを確認します。 推測せず実証してください。それが主権の主張を監査可能にするものだからです。
簡単な方法は2つあります。ネットワークアダプターを無効化(またはケーブルを抜く)して推論がなお動くことを確認する方法。これはモデルが接続性を必要としない証拠になります。あるいはネットワークは有効のまま、パケットキャプチャやプロセス別ファイアウォールで送信接続を監視し、セッション中にOllama/LM Studioプロセスが1つも開かないことを確認する方法です。
設定のコツ:temperature 0.6、システムプロンプトなし
temperatureを0.6に設定し(0.5–0.7が安全)、システムプロンプトを使わず、すべての指示をユーザープロンプトに入れます。 これはDeepSeek-R1 distillが陥りやすい繰り返しと非整合の障害モードを回避し、オフラインでもオンラインと同じくらい重要です。
ハードウェアを買うかAPIを使うか?
これが本当の判断であり、DeepSeekをどれだけ実際に使うかに左右されます。抽象的にどちらが「優れているか」ではありません。
- ハードウェアを買うべき場合: DeepSeekを毎日使う、業務上プライバシーが重要、オフライン運用が必要、同じマシンで複数のローカルサービスを動かす予定がある、すでに適したハードウェアを持っている、あるいはベンダーの価格変更に左右されない長期的で予測可能なアクセスを望む場合です。
- APIを使うべき場合: DeepSeekを断続的にしか使わない、ハードウェアやソフトウェアスタックを維持したくない、エンタープライズ級GPUを買わずに最大の推論速度が欲しい、あるいはオフライン運用が自分の用途では実質的に重要でない場合です。
- DeepSeekの現行API価格(上記で確認済み)は非常に低く、断続的な利用者はコスト節約目的でハードウェアを買うより、単純にAPI利用料を払う方がほぼ確実に得です。ハードウェアの意義はプライバシーとコントロールであって、確実な節約ではありません。
- 決める前にローカルAIコスト計算機で自分の数字を計算してください。想定月間API支出とハードウェア価格を入れれば、経験則ではなく実際の損益分岐点の見積もりが得られます。
予算階層別ハードウェア
2026年の重要な背景:メモリ市場の圧力によりGPUとVRAMの価格はこの1年で大幅に上昇しました。2025年に約$1,000〜1,300だった中古の24 GBカードは、2026年8月時点では約$2,200〜2,800で取引されています。 昨年の価格がそのまま通用すると考えず、予算を見直してください。入門の16 GB階層は比較的安定しています。日本円ベースでは為替や国内小売価格により変動するため、正確な換算は行わず米ドル表示のままとしています。
予算 | 目標 | 備考 |
|---|---|---|
| $500未満 | DeepSeek 7B、小規模な14Bワークロード | 中古または入門GPUシステム |
| $500〜900 | ローカルDeepSeek 14B | 16 GB GPU。初心者向けの最適解で、価格は比較的安定 |
| $1,500〜3,000 | DeepSeek 32B | 24 GB GPU。この階層は2026年に大幅値上がり。購入前に現行価格を確認 |
| $3,000以上 | 本格的なローカルAI、拡張余地あり | 24 GB+ GPU、64〜128 GB RAM、複数のNVMeドライブ |
| $5,000以上 | 70B以上のモデル | この予算帯では専用AIワークステーション構成をクラウド/API費用と比較。ワークステーション構築ガイドを参照 |
買うべきでないもの
「これを買えばいい」しか言わないページはセールスページに見えてしまうため、よくある失敗をはっきり挙げておく価値があります。
- 7Bモデルを動かすためだけに$2,000以上のGPUシステムを買わないこと。入門階層ですでに十分対応できる無駄な出費です。
- 実際に必要とするワークロードなしに128 GBのシステムRAMを買わないこと。GPU推論での本当のボトルネックは通常システムRAMではなくVRAMです。
- スペック表が魅力的に見えるという理由だけでAMD GPUを買わないこと。まず自分が使う正確なランタイムでのROCm/ソフトウェア互換性を確認してください。
- 高速な70Bやフル671B推論を期待してmini PCを買わないこと。その規模でのメモリと演算の要件はまったく別のハードウェアクラスです。
- 計算せずにローカルの方が安いと決めつけないこと。断続的な利用者はAPIの方がほぼ確実に向いています(上記のコスト比較を参照)。
よくある質問
DeepSeekは完全オフラインで動きますか?
はい。distillをダウンロードすれば、ネットワークを無効化した状態でも推論を続けられます。ネットワークを切断・完全ブロックしてもローカルの重みから動作し続けます。
DeepSeek-R1を中国で使うのにVPNは必要ですか?
モデルをローカルで実行する場合は不要です。オフラインモデルには到達すべき海外エンドポイントがないため、VPNやファイアウォール回避は推論に無関係です。唯一のネットワーク作業は、マシン上の他のものがデータを外部送信しないようにすることです。
中国語にはどのDeepSeek distillが最適ですか?
Qwen2.5ベースのdistill(7B、14B、または32B)です。Qwen2.5は中国語カバレッジが強いため、Llama 3ベースの8Bや70B distillより中国語のプロンプトと出力を得意とします。
DeepSeek 32Bにはどれだけのvramが必要ですか?
24 GBのGPUが量子化された32B構成の実用的な目安です。量子化とランタイムによって変わります。詳しい階層内訳は上記の「どのモデルを、どれだけのVRAMで?」の表を参照してください。
mini PCでDeepSeekを動かせますか?
はい。特に7B distillと一部の14B構成で動きます。mini PCは常時稼働・低消費電力のエンドポイントに適した選択肢ですが、DeepSeekの最大性能や70B以上のモデルには一般的に向いていません。
Apple SiliconでDeepSeekを動かせますか?
はい。大容量の統合メモリを持つApple Siliconシステムは、ローカルLLMの実験にとりわけ興味深い選択肢になり得ます。利点が従来型のGPU VRAMではなく共有メモリ容量にあるためです。上記の「最適なハードウェアクラス」セクションを参照してください。
ローカルDeepSeekはAPIより安いですか?
必ずしもそうではありません。ハードウェアには相当な初期費用がかかり、DeepSeekの現行API価格は低いです。ローカル展開の最大の利点はプライバシー・コントロール・オフライン運用であり、確実なコスト節約ではありません。リンク先のコスト計算機で自分の数字を計算してください。
オフラインモデルがどこにもデータを送っていないとどう確認しますか?
セッション中の送信トラフィックを監視するか、ネットワークを完全に無効化して推論がなお動くことを確認します。ローカルに読み込んだモデルは推論のためにDeepSeek APIへの接続を本質的には必要としませんが、思い込みではなく自分のデプロイで実際に検証すべきです。
DeepSeekのオフライン実行に向いているハードウェアは何ですか?
16 GBのGPUは14B distillを、24 GBのGPUは32Bを動かします。静かな常時稼働エンドポイントには、能力のあるmini PCが7Bと14Bを扱います。正確な対応はGPUおよびVRAMのBiteを参照し、NVIDIA/AMD/Apple Silicon/mini PCのトレードオフは「最適なハードウェアクラス」セクションを参照してください。
フルのDeepSeek-R1をオフラインで動かせますか?
コンシューマー向けハードウェアでは無理です。フルの671B R1はQ4レベルの量子化で約400 GB以上のVRAMを必要とします。オフラインのセルフホストでは、現実的にはローカルGPUで動くdistill(1.5B〜70B)を使います。
ファイアウォールとネットワークの手順はどこにありますか?
本ガイドはファイアウォールとエアギャップの仕組みを意図的に再説明しません。完全なネットワークロックダウンは「ファイアウォール越しのローカルAI:オフライン 2026」を参照してください。ここではDeepSeekのモデル選定、ハードウェア、オフラインモデルのセットアップを扱います。
オフラインDeepSeekにはどの設定を使うべきですか?
temperature 0.6、システムプロンプトなし、指示はユーザーメッセージに入れます。これは標準のDeepSeek-R1設定で、繰り返し障害モードを防ぎます。
更新ログ
- 2026-08-25にアフィリエイトページとして全面刷新:ハードウェアクラス別の内訳(NVIDIA/AMD/Apple Silicon/mini PC/クラウド)、推奨構成の目標、検証済みのDeepSeek API価格比較、購入対API判断のセクション、修正済みの2026年ハードウェア予算表(GPU/VRAM価格は前年比で大幅上昇)、そして「買うべきでないもの」セクションを追加しました。「DeepSeekのオープンウェイトにはテレメトリがない」という過大な主張を修正し、デプロイごとに実証的に検証すべきという表現に改めました。
- 2026-06-19公開。次回レビュー予定は2026-09-25(月次フレッシュネス階層、GPU/API価格の急速な変動を反映)。
- DeepSeekのオフラインモデル選定、中国語モデルの選択、ハードウェアクラスの選択、オフラインモデルのセットアップを扱います。ネットワーク/ファイアウォールの仕組みは意図的にリンクで案内。DeepSeek自体のAPIではなく、DeepSeekを取り巻くハードウェアインフラ(GPU/Mac/mini PC/ワークステーションガイド)を収益化します。
