Skip to main content
PromptQuorumBuilt for humans. Structured for AI.
ホーム/ローカルLLM/Ollama最新バージョン2026:v0.33.1 + トップ10オープンソースモデル
Best Models

Ollama最新バージョン2026:v0.33.1 + トップ10オープンソースモデル

·9分で読める·Hans Kuepper 著 · PromptQuorumの創設者、マルチモデルAIディスパッチツール · PromptQuorum

2026年8月更新。現在のOllamaバージョンはv0.33.1(2026年8月26日リリース)で、MLX Qwen3.8 Flash Nextのサポート、構造化出力、GPUタイムアウト修正を追加しました。v0.33系列ではClaude Desktopゲートウェイ対応も加わっています。ライブラリに加わった最新モデルはLaguna XS 2.1(Poolside、7月2日、33B総パラメータ/3B活性MoE、エージェント型長期タスク・コーディング向け、256Kコンテキスト)とKimi K2.7 Code(Moonshot AI、Kimi K2.6ベースのコーディング特化エージェントモデル)で、Kimi K2.6、Qwen3.8、GLM-5.3、gpt-oss、Gemma 4に加わります。全体での最多ダウンロードは引き続きLlamaファミリー(Llama 4 Scout、Llama 3.x)、コンシューマーハードウェアでの総合最高はQwen3.8-27B(61.7% SWE-bench)です。

スライドデッキ: Ollama最新バージョン2026:v0.33.1 + トップ10オープンソースモデル

下記のスライドデッキは以下をカバーしています:ダウンロード数別の Top 10 Ollama モデル、パフォーマンス比較(60-74% HumanEval)、ユースケース別の最高モデル(チャット、コーディング、推論、ビジョン)、DeepSeek-R1 chain-of-thought 推論、および正確なプルコマンド。Ollama モデル選択リファレンスカードとして PDF をダウンロードしてください。

以下のスライドを閲覧するか、PDFとしてダウンロードしてください。 リファレンスカードをダウンロード(PDF)

Ollama最新バージョン2026:v0.33.1 + トップ10オープンソースモデル

重要なポイント

  • コンシューマー向け総合最高:Qwen3.8-27B(61.7% SWE-bench、Q4で24GBに収まる)。バランス型:qwen3:30b。
  • 最多ダウンロード:Llama 3.2 3B(チュートリアル向け)とLlamaファミリー。
  • 推論最強:DeepSeek-R1(Chain-of-Thought)とgpt-oss:20b(推論調整可能、~o3-miniレベル)。 (DeepSeekはその後、オープンウェイトの新世代としてDeepSeek-V4—Flash/Pro—をリリースしました。R1/V3は引き続きローカルで利用可能です。)
  • コーディング最強:Kimi K2.6(Frontier MoE)、Qwen3.8-27B(最高密度)、Devstral Small 24B(最高エージェント)、qwen3-coder:30b(補完)。
  • 小型・16GB最強:gpt-oss:20b。ビジョン/マルチモーダル最強:Gemma 4(E4B以上)。長コンテキスト(10M)/ 大規模マルチモーダル最強:Llama 4 Scout(~55GB)。
  • うんちく系/検閲なし総合最強:Dolphin 3.0(`ollama pull dolphin3`)。Cognitive Computationsが保守、Llama 3.1ベース、コンテンツフィルタリングなし。
  • Ollamaライブラリ7月2026:数百のモデル。すべて`ollama pull <名前>`で利用可。

📍 一文で説明

2026年7月時点で最良のOllamaモデルはQwen3.8-27B(61.7% SWE-bench、Q4で24GBに収まる)で、コーディングにはKimi K2.6またはLaguna XS 2.1が最適です。

💬 簡潔に説明

Ollamaは、インターネットやAPIキーなしで自分のコンピューター上でAIモデルを実行できる無料のツールです。ここでは、用途別に整理された、1つのコマンドでダウンロードできる主要モデルを紹介します。

Ollamaの最新バージョンと変更点は?

現在のOllamaバージョン:v0.33.1(2026年8月26日リリース)。これが最新の安定版で、ollama.com/downloadから入手できます。8月27日にv0.33.2のリリース候補版が公開されましたが、まだ安定版ではありません。`curl https://ollama.ai/install.sh | sh`(macOS:`brew upgrade ollama`)でアップデートし、`ollama --version`で確認してください。

v0.32〜v0.33系列の変更点(2026年7月〜8月): v0.32.0(7月11日)は「Chat, Code & Work」エージェント体験を導入。v0.32.12(8月14日)はQwen 3.8 27Bのサポートと、Apple Silicon向けMLX最適化版を追加。v0.32.13(8月14日)はqwen3.8の開発者インストラクション対応を追加。v0.32.14(8月15日)はllama-serverレンダラー向けWebPトランスコーディングを実装。v0.32.15(8月19日)は新しいデスクトップオンボーディングを追加し、モデル読み込みの高速化により初回トークンまでの時間をほぼ半減。v0.33.0(8月21日)はClaude Desktopをサードパーティゲートウェイとして利用可能にし、KVキャッシュの復元ポイントを大幅に安定化。中断された長いprefillを最初からやり直さず再開できます。v0.33.1(8月26日)はMLX Qwen3.8 Flash Nextのサポート、構造化出力、低速ストレージ環境でのGPUタイムアウト修正を追加。詳細:github.com/ollama/ollama/releases。

今月追加された最新モデル(2026年7月):

  • Laguna XS 2.1(Poolside、2026年7月2日)— エージェント型・長期タスクコーディング向けモデル:33B総パラメータ / 3B活性MoE、256Kトークンのコンテキストウィンドウ、SWE-bench Verified 70.9%、SWE-bench Multilingual 63.1%。OpenMDW-1.1ライセンス。プル:`ollama pull laguna-xs-2.1`、実行:`ollama run laguna-xs-2.1`
  • Kimi K2.7 Code(Moonshot AI、2026年6月頃)— Kimi K2.6をベースに構築されたコーディング特化のエージェントモデル。プル:`ollama pull kimi-k2.7-code`
  • DeepSeek V4 Pro(DeepSeek、2026年4月23日)— アルゴリズミックコーディングの専門モデル、93.5% LiveCodeBench、MITライセンス。軽量ハードウェア向けの廉価版DeepSeek V4 Flashもあります。プル:`ollama pull deepseek-v4-pro`
  • Kimi K2.6(Moonshot AI、2026年4月20日)— フロンティアコーディングモデル、SWE-Bench Pro 58.6、SWE-bench Verified 80.2%。MoEアーキテクチャ(32B活性/1T合計)。Modified MIT ライセンス。
  • Qwen3.8-27B(Alibaba、2026年4月16日)— コンシューマー向け総合最高、61.7% SWE-bench、Apache 2.0、Q4で24GBに収まる。Qwen3.6-35B-A3B(MoE、73.4 SWE-bench)も。
  • GLM-5.3(Z.ai)— 744B / 40B活性MoE、MITライセンス。構造化コード生成リーダー。
  • gpt-oss(OpenAI、2026年)— オープンウェイトMoE:gpt-oss:20b(21B合計 / 3.6B活性、16GBで動作、~o3-miniレベル、推論調整可能)とgpt-oss:120b(80GB)。
  • Gemma 4(Google、2026年4月2日)— マルチモーダルサイズ E2B / E4B / E12B(26B MoE)/ E27B(31B密度)、すべてビジョンとツール呼び出し対応。QAT重みを2026年6月5日に追加。v0.31.1のMLXバッチ行列積カーネル刷新でApple Silicon推論が約90%高速化。E4Bは~6GB VRAMで動作。
  • Dolphin 3.0(Cognitive Computations、継続保守)— 検閲なし・汎用チャットモデル、Llama 3.1ベース、コンテンツフィルタリングなし。プル:`ollama pull dolphin3`(旧`dolphin-mistral`は2024年の古いモデルのため非推奨)。
bash
# Ollamaを最新版にアップデート(v0.33.1)
curl https://ollama.ai/install.sh | sh

# またはMac:brew upgrade ollama

# 現在のバージョンを確認
ollama --version  # 出力:ollama version 0.33.1

# 2026年7月の最新モデルをプル
ollama pull laguna-xs-2.1
ollama pull kimi-k2.7-code
ollama pull dolphin3

カテゴリ別トップモデル

モデルの出力品質はプロンプトの設計に大きく左右されます。Chain-of-Thought、Few-Shot例、出力フォーマットなど、すべてのローカルモデルで使える構造化テクニックについてはプロンプトエンジニアリングガイドをご覧ください。推論タスク用に、Chain-of-ThoughtプロンプティングはDeepSeek-R1とQwen3出力品質を大幅に改善。各モデルに必要なRAMを確認するには、VRAM要件ガイド →をご参照ください。Gemma 4エージェントワークフロー用はTree-of-Thoughtと ReAct参照。このリストにあるツール呼び出し対応モデルを、ファイルアクセスやデータベース照会まで含むマルチステップのループに組み込む方法は、MCP を使ったローカル AI エージェントを参照してください。オープンソースのオーケストレーションパターンを解説しています。

  • 一般チャット(初心者):`ollama run llama3.2:3b` -- ドキュメント多数、最適入門モデル。
  • 一般チャット(最良の選択):`ollama run qwen3.8:27b` -- 61.7% SWE-bench、コンシューマー向け総合最高、Q4で24GBに収まる。バランス型:`ollama run qwen3:30b`。8GB機はllama3.2:3b維持。
  • 長コンテキスト / マルチモーダル:`ollama run llama4:scout` -- 10Mトークンコンテキスト + マルチモーダル、MoE(17B活性/109B合計)。Q4で~55GB VRAM必要(24GBは1.78ビットのみ、~20 tok/s)。
  • 小型・16GB最強:`ollama run gpt-oss:20b` -- 21B合計 / 3.6B活性MoE、~o3-miniレベル、推論調整可能。大型:`ollama run gpt-oss:120b`(80GB)。
  • コード(7B):`ollama run qwen3:8b` -- 76% HumanEval、Qwen3から改善、多言語対応。
  • コード(最高エージェント、24B):`ollama run devstral-small:24b` -- 最高エージェントコーディング(マルチファイル編集、デバッグ)。16GB RAM。Mistral AI製。
  • コード(最高密集、27B):`ollama run qwen3.8:27b` -- 61.7% SWE-bench。最高密集コーディングモデル。22GB VRAM。
  • コード(フロンティアMoE):`ollama run kimi-k2.6` -- SWE-Bench Pro 58.6(GPT-5.5と同等)、トップティア。MoE(32B活性/1T合計)。Modified MIT License。
  • コード(エージェント型・長期タスク):`ollama run laguna-xs-2.1` -- SWE-bench Verified 70.9%、SWE-bench Multilingual 63.1%、256Kコンテキスト。33B総パラメータ/3B活性MoE。OpenMDW-1.1ライセンス。
  • エージェント・ツール呼び出し:`ollama run gemma4:e4b` -- 2026年4月2日リリース。組み込みツール呼び出し+ビジョンサポート。ローカルエージェント、機能呼び出し、構造出力推奨。6GB RAM。
  • 推論・数学:`ollama run deepseek-r1:7b` -- Chain-of-Thoughtモデル、ローカル数学最高性能at 7B。
  • 多言語:`ollama run qwen3:8b` -- 29+言語対応、非英語対応最強、76% HumanEval。
  • 画像理解:`ollama run gemma4:e4b` -- Vision + Tool Calling。v0.31.1のMLXカーネル刷新でApple Silicon推論が約90%高速化。または `ollama run llama3.2-vision:11b`専用Vision。
  • うんちく系/検閲なし:`ollama run dolphin3` -- Dolphin 3.0、Llama 3.1ベース、コンテンツフィルタリングなし。Cognitive Computations製。
  • 高速・軽量:`ollama run gemma2:2b` -- 最速CPU推論、1.7GB RAM。
  • 高品質(16GB RAM):`ollama run mistral-small3.1` -- 70B品質に近い14GB RAM。
  • ホームオートメーション / ウェイクワードAI:`ollama run phi4-mini` — Phi-4 Mini(3.8B、VRAM約3 GB)は専用GPUなしのミニPCでHome Assistantの音声コマンドを20〜25 tok/secで処理できます。Home Assistant + Ollama 統合ガイド →をご覧ください。
用途別Ollamaモデル選択:2026年7月。チャット:llama4:scout、コーディング:qwen3.8:27b、推論:deepseek-r1:7b。
用途別Ollamaモデル選択:2026年7月。チャット:llama4:scout、コーディング:qwen3.8:27b、推論:deepseek-r1:7b。

DeepSeek-R1:推論ブレークスルー

DeepSeek-R1は2025年1月リリース。ローカルサイズでの推論大躍進。Chain-of-Thought(CoT)実装で思考過程を表示。

  • サイズ展開:1.5B(モバイル)、7B、70B。1.5Bは教育端末で十分。7Bはllama 3.1 13Bを数学で上回る。
  • ベンチマーク:52% MATH(Llama 3.1 8B比23%)。ロジック・多段階問題解決向上。
  • RAM必須:1.5B:2GB、7B:6GB、70B:44GB(Q4量子化)。
  • ライセンス:DeepSeek License(逆アセンブリ制限あり。エンタープライズ前に確認)。
  • 日本データ処理:APAC地域デプロイ時、DeepSeek-R1はデータ保護方針準拠。ローカル実行で主権確保--クラウド転送なし。
bash
ollama run deepseek-r1:7b
# プロンプト例:「時速100kmで駅に近づく列車2台、いつ出会う?」
# DeepSeek-R1:7bが思考過程を表示:
# <思考>
# ...経路を探索、仮定を検証...
# </思考>
# 答え:彼らは出会う...
DeepSeek-R1 7B vs Mistral Small: MATH 52% vs 28%。思考連鎖推論モデル -- やや遅いが精度が大幅に向上。
DeepSeek-R1 7B vs Mistral Small: MATH 52% vs 28%。思考連鎖推論モデル -- やや遅いが精度が大幅に向上。

ビジョンモデル

4つの優秀ビジョンモデルがOllamaネイティブ対応:

モデル
RAM
画像対応
Ollamaコマンド
Llama 3.2 Vision 11B11 GBJPEG、PNG、GIF・複数画像入力ollama run llama3.2-vision:11b
Qwen2-VL 7B8 GBJPEG、PNG・OCR精密ollama run qwen2-vl:7b
Gemma 3 Vision 9B9.5 GBJPEG、PNG・ネイティブ128Kコンテキストollama run gemma3:9b
Mistral AI Pixtral 12B12.5 GBJPEG、PNG・潜在表現ollama run pixtral:12b
4つのOllamaビジョンモデル: llama3.2-vision:11b (8 GB)、gemma3:9b (6 GB)、minicpm-v (5.5 GB)。全てローカル実行。
4つのOllamaビジョンモデル: llama3.2-vision:11b (8 GB)、gemma3:9b (6 GB)、minicpm-v (5.5 GB)。全てローカル実行。

トップ10完全比較

2026年4月Ollama月間DL数トップ10:

#
モデル
最適用途
RAM
HumanEval
1Llama 3.1 8B初心者・汎用6.5 GB68.2%
2Qwen3 8Bコード・数学6.5 GB75.4%
3Mistral Small多言語6.5 GB73.2%
4Llama 3.3 70B高スループット44 GB86.1%
5DeepSeek-R1 7B推論6.5 GB76.8%
6Gemma 3 9Bビジョン+テキスト9.5 GB72.1%
7Llama 3.2 Vision 11Bマルチモーダル11 GB71.5%
8Phi-3.5 Mini 3.8B小型端末3 GB61.2%
9Qwen3 32B品質重視20 GB81.7%
10Mistral Small 3.1高速・軽量5 GB68.9%
ダウンロード数Top 10 Ollamaモデル: RAM 1.7 GB (gemma2:2b)から14 GB (mistral-small3.1)。HumanEval 39-74%。
ダウンロード数Top 10 Ollamaモデル: RAM 1.7 GB (gemma2:2b)から14 GB (mistral-small3.1)。HumanEval 39-74%。

Ollama ライブラリの探索方法

Ollamaモデルの操作には2つの方法があります。インストール済みモデルの切り替え: Ollama Macアプリのチャット入力欄下部にあるモデルドロップダウンボタン(例:"gemma3:1b"と表示)をクリックして、ローカルにインストールされたモデルを切り替えます。新しいモデルの検索・ダウンロード: ollama.com/libraryで数百のモデルをカテゴリ別に検索し、以下のCLIコマンドでインストールします。

  • ブラウザで ollama.ai/library を開く。数百のモデル検索可能。
  • フィルタオプション:モデルサイズ、ライセンス、リリース日、ベンチマーク(MMLU、HumanEval、MATH)。
  • モデル評価:ユーザーDL数、GitHub⭐(ベースモデル)、Ollama⭐。
  • Ollama新モデル:毎週木曜日UTC 18:00更新。
bash
ollama list
# インストール済みモデル表示

ollama pull llama3.1:8b
# Llama 3.1 8B ダウンロード・インストール

ollama pull qwen2.5:7b
# Qwen3 8B ダウンロード(コード・数学向け)

ollama run qwen2.5:7b
# インタラクティブセッション開始

ollama run -m deepseek-r1:7b "2^10を解く"
# CoTで推論タスク実行

Ollama選択の一般的ミス

Ollamaの最新バージョンは?

Ollamaの最新安定版はv0.33.1(2026年8月26日リリース)です。8月27日にv0.33.2のリリース候補版が続きましたが、まだ安定版ではありません。ollama.com/downloadから入手するか、Linuxでは`curl https://ollama.ai/install.sh | sh`、macOSでは`brew upgrade ollama`で更新できます。

Ollamaの変更履歴とリリースノートはどこで見られますか?

各バージョンのリリースノートはgithub.com/ollama/ollama/releasesにあり、タグごとに日付と変更履歴が記載されています。最新の項目はv0.33.1(2026年8月26日 — MLX Qwen3.8 Flash Next、構造化出力、GPUタイムアウト修正)、v0.33.0(8月21日 — Claude Desktopゲートウェイ、KVキャッシュ復元ポイント)、v0.32.15(8月19日 — 新しいデスクトップオンボーディング、モデル読み込み約2倍高速化)です。

インストール済みのOllamaバージョンを確認するには?

ターミナルで`ollama --version`を実行します。`ollama version 0.33.1`のような行が出力されます。番号が最新版より低い場合は、`curl https://ollama.ai/install.sh | sh`(Linux)または`brew upgrade ollama`(macOS)で更新し、再度`ollama --version`で確認してください。

大きいモデルタグをプルしたがRAM満杯。何が?

確認なしプル。プル前に`ollama show [model-name]`実行。例:`ollama show llama3.1:70b`でRAM表示(約42-48GB、Q4量子化)。初心者は7B-13Bに留める(RAM 16GB以下)。`ollama rm [model-name]`で削除。

Llama 3.3みたいな汎用モデル使うがコード遅い。なぜ?

Llama 3.1 8Bは汎用向きだがQwen3やMistral Smallは技術専門。コード:Qwen3 8B切替(HumanEval 75.4% vs Llama 68.2%)。両方RAM 8GB以下。

モデルプルしたが表示されない。確認は?

`ollama list`実行。モデルはMac: `~/.ollama/models/`またはWindows: `%USERPROFILE%.ollamamodels`に保存。表示されなければOllamaデーモン再起動:終了して再起動。

次のステップ

よくある質問

Ollamaの最新バージョンは?

Ollamaの最新安定版はv0.33.1(2026年8月26日リリース)です。8月27日にv0.33.2のリリース候補版が続きましたが、まだ安定版ではありません。ollama.com/downloadから入手するか、Linuxでは`curl https://ollama.ai/install.sh | sh`、macOSでは`brew upgrade ollama`で更新できます。

Ollamaの変更履歴とリリースノートはどこで見られますか?

各バージョンのリリースノートはgithub.com/ollama/ollama/releasesにあり、タグごとに日付と変更履歴が記載されています。最新の項目はv0.33.1(2026年8月26日 — MLX Qwen3.8 Flash Next、構造化出力、GPUタイムアウト修正)、v0.33.0(8月21日 — Claude Desktopゲートウェイ、KVキャッシュ復元ポイント)、v0.32.15(8月19日 — 新しいデスクトップオンボーディング、モデル読み込み約2倍高速化)です。

インストール済みのOllamaバージョンを確認するには?

ターミナルで`ollama --version`を実行します。`ollama version 0.33.1`のような行が出力されます。番号が最新版より低い場合は、`curl https://ollama.ai/install.sh | sh`(Linux)または`brew upgrade ollama`(macOS)で更新し、再度`ollama --version`で確認してください。

ローカルモデルに必要なRAM量は?

7B:6.5-8GB。13B:11-14GB。70B:42-48GB(Q4_K_M量子化)。3B:2-3GB。プル前に`ollama show [model-name]`で確認。

Ollamaモデルはオフラインで実行できる?

はい。初期DL後、推論は完全ローカル実行。インターネット不要。Ollamaが定期更新確認(自動適用なし)。

日本語サポート最高のモデルは?

Qwen3 8B。CulturaXと日本語Wikiで高精度。Llama 3.3は日本語OK但しQwenが精密。Mistral Smallは仏語西語向き。

Ollamaモデルは本当に無料?

はい。全Ollamaモデルはオープンソース・フリーライセンス(Apache 2.0、Meta Llama Community、Deepseek)。サブスク・API料金なし。DL・ローカルインストール・無制限使用。

DeepSeek-R1の速度は本当?

生成速度:M1 Pro 15-25tokens/秒(Llama 3.3 7B相応)。総レイテンシは思考過程生成で高い--中程度クエリ8-12秒。リアルタイム:Llama 3.3やMistral。

OllamaでなくChatGPT Plusを選ぶ理由は?

プライバシー:チャットがOpenAIに送信されない。コスト:月額なし・GPU買い切り。オフライン:完全インターネット不要。カスタマイズ:システムプロンプト・動作・パラメータ全掌握。

Ollamaモデルは画像処理できる?

はい。Llama 3.2 Vision、Qwen2-VL、Gemma 3全てマルチモーダル。画像をローカルファイルアップロード。クラウド転送なし。JPEG、PNG、GIF対応。

Ollamaモデルを新版にアップデートは?

`ollama pull [model-name]`再実行。差分のみDL(重複排除)。旧版削除:`ollama rm [model-name]:tag`。

GDPRはOllamaで気にすべき?

はい。GDPR個人データセキュリティ必須。ローカル推論で設計による保護要件満たし。クラウド転送なし=主権・非エクスポート・コンプライアンス。注:クラウドモデル使用時は処理契約確認。

日本企業向けOllama活用は?

はい。日本企業が利益:データ主権(クラウドロックイン回避)、IT標準準拠(IPA・MEI-TI Governance 2024)、標準HW スケーラビリティ、API料金排除。Qwen3 8Bは標準デスクGPUで実行。Llama 3.1 8Bはエンタープライズスタンダードツール・顧客自動化・文書処理向け検証済み。

Ollamaを開発している会社の正式名称は何ですか?

同社はOllama Inc.で、カリフォルニア州パロアルトを拠点とするシリーズB資金調達済みのスタートアップです。2023年にJeffrey MorganとMichael Chiangによって設立されました。

ロシア語タスクに最適なOllamaモデルはどれですか?

Qwen3/Qwen 3.6とMistral Small 3.1はどちらもロシア語をネイティブの多言語トレーニングデータに含みます。非英語ベンチマークではQwen3が高いスコアを示す一方、Mistral Small 3.1は非公式な会話的ロシア語の流暢さで評価されることが多いです。どちらもロシア発のモデルではありません。

OllamaでどのDolphinモデルを使うべきですか?

`ollama pull dolphin3`(Dolphin 3.0)を使用してください。Cognitive Computationsが保守する現行版で、Llama 3.1をベースにコンテンツフィルタリングなしで構築されています。旧版の`dolphin-mistral`は2024年リリースで更新が止まっています。

参考資料

ソース

サードパーティの情報に関する注意

この記事はサードパーティのAIモデル、ベンチマーク、価格、ライセンスを参照しています。AIの状況は急速に変化しています。ベンチマークスコア、ライセンス条件、モデル名、API価格は執筆時とお読みになる時の間で変わる可能性があります。この記事に基づいてデプロイやコンプライアンスに関する決定を下す前に、各プロバイダーの公式ソース(ライセンスとベンチマークはHugging Faceのモデルカード、API価格はプロバイダーのウェブサイト、現在のGDPRとEU AI法のテキストはEUR-Lex)で最新の数値を確認してください。

ローカルLLM、独自のAPIキー、またはその両方でPromptQuorumを使用できます — バックエンドはあなたが選択します。

PromptQuorumベータ版をダウンロード →

← ローカルLLMに戻る