Skip to main content
PromptQuorum
ホーム/ローカルLLM活用/カメラとドローンのVLM 2026:オンデバイス映像理解の実践
Mobile & Edge LLMs

カメラとドローンのVLM 2026:オンデバイス映像理解の実践

·13分で読める·Hans Kuepper 著 · PromptQuorumの創設者、マルチモデルAIディスパッチツール · PromptQuorum

カメラとドローンが推論をオンデバイスに移すのは、プライバシーではなく帯域幅と通信リンクの制約が生の映像ストリーミングを非現実的にするためです。 連続的な4Kセキュリティストリームは、保存期間全体で見ると、カメラ内で処理するアクセラレーターよりも高い転送・保存コストがかかります。運用距離にあるドローンは断続的で低帯域、時に妨害を受ける可能性のある無線リンクに直面するため、機体上での演算だけが見たものに対応する唯一の手段です。両者は同じ変化を裏付けています——固定クラスの物体検出から、記述されたイベントを固定クラスのリストと照合するのではなく検索するオープンボキャブラリーVLM検索への移行です。

カメラとドローンには、映像AIをどこで実行するかを決める共通の制約があります。それは演算能力ではなく帯域幅です。本ガイドでは、映像解析のためのカメラ内蔵型・エッジアプライアンス型・クラウド型アーキテクチャを比較し、固定クラス検出からオープンボキャブラリーVLM検索への移行を解説し、カメラとドローン機体に今まさに搭載されている演算プラットフォームを取り上げます。

カメラとドローンのVLM 2026:オンデバイス映像理解の実践

重要なポイント

  • プライバシーではなく帯域幅と通信リンクの制約が、カメラ・ドローンの推論をオンデバイスに移す理由です。連続的な4Kストリームはローカルで処理するチップより転送・保存コストが高くなります。
  • 映像解析は固定クラス検出からオープンボキャブラリーVLM検索へ移行しています——事前学習されたクラスリストと照合するのではなく、平易な言葉でイベントを記述して検索します。
  • カメラ用シリコン:Hailo-10HとHailo-15は5W未満のカメラ内蔵GenAIを狙い、Ambarella Nシリーズ(CES 2026で発表)はマルチセンサー認識を備えた8KエッジAIビジョンSoCを追加しました。
  • エッジアプライアンス(NVIDIA Jetson Orin/Thor)は多数のカメラフィードを現地で集約します。Jetson Thorは最大32のMIPI CSI-2カメラ入力に対応します。
  • ドローンは機体上で演算を実行します。Qualcomm QRB5165をベースとしたModalAI VOXL 2は、オートパイロット、GPSフリー視覚慣性オドメトリ、推論を約16gのモジュールに統合しています。
  • 実際の導入の多くはハイブリッドです——軽量な固定クラス検出器が常時稼働し、VLMはトリガーされたクリップのみを処理し、すべてのフレームは処理しません。
  • VLMは固定クラス検出を置き換えるものではありません——連続的なフレーム単位のトリアージを続ける検出器の上に、オープンボキャブラリー検索を追加するものです。

プライバシーが話題になる前に、なぜ映像AIはエッジに移るのか?

帯域幅と物理的な通信リンクの制約が、カメラ・ドローンの推論をオンデバイスに移す主な理由です——経済的な議論がプライバシーの議論より先に来ます。 15〜30fpsで連続ストリーミングする4Kカメラは持続的なビットレートを生成し、複数カメラを持つ拠点と30日間の保存期間にわたって、カメラ内蔵またはエッジアプライアンスアクセラレーターの一回限りのコストよりも早く転送・保存コストを積み上げます。このページ下部の計算機で、ご自身のカメラ台数と保存期間についてこの計算を実行できます。

ドローンは逆方向から同じ制約に直面します。安く移動させるにはデータが多すぎるのではなく、頼りにできる信頼性の高いリンクが少なすぎるのです。運用距離にあるドローンは断続的で低帯域、時に妨害を受ける可能性のある無線リンクを持っています——ドローンが見たものを解釈するために常時クラウド接続に依存するミッションは、GPS妨害や目視外飛行時など、機体が自律的に行動する必要があるまさにその瞬間に機能しなくなります。

これは、このサイトの既存のローカルLLMコンテンツが消費者向け・デスクトップAIで通常使うプライバシー優先の論法とは異なる切り口です。カメラとドローンの場合、購入者の最初の質問は「これだけの映像を動かす余裕があるか、リンクが安定していると信頼できるか」です——プライバシーとデータ所在地は現実的な副次的利益であり、このアーキテクチャが存在する理由そのものではありません。

📍 一文で説明

映像AIがオンデバイスに移るのは、転送・保存コストと信頼性の低い無線リンクが、プライバシーが要因になる前からクラウド依存の推論を非現実的にするためです。

💬 簡潔に説明

各カメラの映像をサーバーに移すにはお金がかかり、安定したリンクが必要です。撮影された場所で処理すれば両方の問題を回避できます。

推論はカメラ内蔵・エッジアプライアンス・クラウドのどれで実行すべきか?

現在、カメラ映像AIには3つのアーキテクチャがあり、実運用の多くは少なくとも2つを組み合わせています。 適切な選択は、拠点あたりのカメラ台数、保存要件、ハードウェア予算がユニット単価をどれだけ吸収できるかによって決まります。

カメラ内蔵推論はアクセラレーターをカメラ自体に組み込みます——Hailo-10HとHailo-15はまさにこの5W未満の設計点を狙っています。各カメラが自身で判断する必要がある場合(動体検知録画、デバイス上での改ざん検知)、かつカメラの部品表が1台あたり1チップを吸収できる場合に使用します。

現地のエッジアプライアンスはNVIDIA Jetson OrinまたはJetson Thorを実行する1台の機器に多数のカメラフィードを集約します。1拠点のカメラ台数が個別に装備するには多すぎる場合に使用します——Jetson Thorが最大32のMIPI CSI-2カメラ入力に対応することは、このプラットフォームがまさにこのマルチカメラ集約の役割を意図していることを示す強いシグナルであり、単一ストリーム推論向けではありません。

クラウド処理は、リアルタイム要件がなく、クリップ単位のレイテンシよりも数か月にわたる全アーカイブの遡及検索が重要で、少数のストリームの帯域幅コストが許容できる、カメラ台数の少ない拠点に依然として適しています。

実際には、この記事で後述する導入の多くはハイブリッドです。固定クラス検出はカメラ内蔵またはエッジアプライアンスで常時稼働し、クラウドストレージが遡及検索用のアーカイブを保持し、VLM推論はより低コストな検出器がすでにフラグを立てたクリップに対してのみ実行されます。

映像解析はどのように検出から記述へ移行しているのか?

映像解析は固定クラスの物体検出からオープンボキャブラリーVLM検索へと移行しています——この市場における最新の変化です。 固定クラス検出器は「この画像に人物、車両、あるいは約80の事前学習済みCOCOカテゴリのいずれかがあるか?」に答えます。オープンボキャブラリーVLMは「積み降ろし場付近に誰かがバッグを置いていったクリップを見つけて」といった記述されたクエリに、固定クラス検出器が一度もカテゴリとして認識するよう訓練されていない映像に対して答えます。

VLMは固定クラス検出器を置き換えるのではなく、その上で機能します。 ビジョン言語モデルは5W未満の電力予算内でストリームあたり毎秒30フレームでは動作しません。完全なVLM推論の演算・レイテンシコストは、その電力エンベロープで全フレームを継続処理するには高すぎます。代わりに、固定クラス検出器は動体・存在・基本分類といった継続的で低電力なトリアージ作業を続け、フラグが立てられたクリップのみがオープンボキャブラリーでの記述や検索のためにVLMへ渡されます。

この二段構えの設計こそ、Hailo-10Hのようなカメラ内蔵シリコンが全フレームVLMプロセッサではなく「エッジのGenAI」アクセラレーターと呼ばれる理由です。このチップは継続的な軽量検出に加え、トリガーされた断続的なVLM推論向けにサイズ設計されており、全フレームレートでビジョン言語モデルを動かすためではありません。

📍 一文で説明

オープンボキャブラリーVLM検索は、固定クラス検出器が一度もカテゴリとして認識するよう訓練されていない映像から記述されたイベントを見つけますが、全フレームではなくトリガーされたクリップに対してのみ動作します。

💬 簡潔に説明

従来の方法:「人物・車・犬に一致するものすべてにフラグを立てる」。新しい方法:「積み降ろし場でバッグを置いていったクリップを見つけて」——安価な検出器がクリップにすでにフラグを立てた後、自分の言葉で。

  • 固定クラス検出:継続的、低電力、「これはN個の事前学習済みカテゴリのどれか?」に答える
  • オープンボキャブラリーVLM検索:トリガー式、電力消費が高い、特定のクリップに対する自然言語記述に答える
  • 両者は競合するのではなく補完し合う——検出器がVLMに何を見せるかを決め、その逆ではない
  • デスクトップ・サーバー向けVLM構成(LLaVA、Qwen3-VLなど)は、このトリガー式クリップ解析に使われるのと同じモデルファミリーを共有しています——組み込み導入を評価する前に下記のデスクトップVLM比較を参照してください

カメラ拠点に実際に必要な帯域幅と保存容量はどれくらいか?

以下にカメラ台数、解像度、フレームレート、保存期間を入力すると、継続的な帯域幅と保存コストを見積もれます。 カメラ内蔵・エッジアプライアンス・クラウドのアーキテクチャを選ぶ前にご利用ください——得られた数字が議論をそのまま決着させることが多いです。

Estimated bandwidth & storage

Continuous bandwidth (all streams): 128 Mbps

Storage for the retention window: 41.5 TB

Estimates from typical H.264 surveillance-quality bitrates, scaled linearly with frame rate. Actual bitrate varies with scene complexity and codec.

カメラまたはドローンのVLM導入をどう評価するか?

6つのチェックが、現場で機能する導入とうまくいかない導入を分けます。 特定のシリコンプラットフォームに決める前に、この順序で実施してください。

  1. 1
    ストリームではなくトリガーを定義する
    Why it matters: ハードウェアを選ぶ前に、VLM推論を発動させるイベント(動体、固定クラス検出器のアラーム、スケジュールされた間隔)を決めてください——すべてのストリームの全フレームに対してVLMを実行することは、2026年時点で存在する電力やコストの予算ではありません。
  2. 2
    シリコンを選ぶ前に通信リンクの予算を測定する
    Why it matters: ドローンの場合、演算プラットフォームを選ぶ前に、運用距離での利用可能なアップリンク帯域幅と最悪ケースのレイテンシを測定してください——演算チップではなく機体の無線リンクが通常、拘束条件になります。
  3. 3
    検出と記述を別の段階として維持する
    Why it matters: 軽量な固定クラス検出器を常時稼働させ、フラグが立てられたクリップのみをVLMに送ってください——これがVLM推論をカメラやドローンの電力予算に収める唯一の方法です。
  4. 4
    電力予算を物理的な筐体に合わせる
    Why it matters: ファンレスのカメラ筐体は熱設計予算を約5Wに制限します。ドローンのペイロードは電力消費だけでなく重量と飛行時間のトレードオフによって制限されます——シリコンではなく筐体に合わせて設計してください。
  5. 5
    ミッションがGPSまたは指令リンクを失う可能性がある場合、GPSフリー運用を検証する
    Why it matters: 視覚慣性オドメトリ(VIO)は、目視外飛行や妨害を受けた電磁環境で頼る前に、機能すると仮定するのではなく具体的にテストする必要があります。
  6. 6
    スケールする前に1拠点または1機体でパイロット運用する
    Why it matters: 艦隊全体への展開に予算を投じる前に、単一の導入で誤検知率、クエリレイテンシ、バッテリー・熱の挙動を検証してください。

なぜドローンは映像をストリーミングせず機上で処理するのか?

ドローンが演算を機体上に移すのは、通信リンクの余裕、レイテンシ、GPSフリーナビゲーションという3つの理由からであり、機上演算が安いからではありません。 ドローンの無線リンクは距離、地形、干渉によって、固定カメラのイーサネットケーブルでは決して起こらないような形で劣化します。映像を解釈するために常時クラウド接続に依存するミッションは、機体が操縦者から最も離れ、自律性を最も必要とするまさにその瞬間に失敗します。

Qualcomm QRB5165を中核に構築されたModalAIのVOXL 2は、機体上演算設計のリファレンスプラットフォームです。 PX4に対応し、衛星測位が利用できない、または妨害されている場合のナビゲーションのためにGPSフリー視覚慣性オドメトリ(VIO)をサポートし、オートパイロット、演算、ナビゲーションセンサーを約16グラムのオートパイロットクラスのモジュールにまとめています——ペイロードとバッテリーが同じ重量予算を奪い合うのに十分小さく、別電源とではありません。

重量と電力は、壁に固定されたカメラでは存在しない形で、機体上では厳格な制約です。 機上演算の1グラムごとに、バッテリー容量、センサーペイロード、飛行時間に使えない1グラムがあります——ドローンプラットフォームは、現地のカメラ拠点がエッジアプライアンスを追加できるようには、単純にラックユニットを追加できません。

  • 通信リンクの余裕:無線接続は距離、地形、干渉を受けたスペクトルによって、有線カメラインフラでは起こらない形で劣化する
  • レイテンシ:ライブの判断(障害物回避、目標追跡)はクラウドサーバーへの往復を待てない
  • GPSフリーナビゲーション:視覚慣性オドメトリにより、衛星測位が利用できないときも機体は位置と方位を維持できる
  • 重量予算:約16gクラスのオートパイロット演算モジュールは、固定カメラの筐体とは異なり、バッテリーとペイロードと直接競合する

カメラ・ドローンVLMは既にどこで商用利用されているか?

4つの商用カテゴリが今日出荷されている導入の大半を占めます:インフラ・公益設備点検、精密農業、測量・マッピング、そして公共安全です。

  • インフラ・公益設備点検:機上演算を搭載したドローンが送電線、パイプライン、携帯電話基地局を点検し、生の映像を確認のためにストリーミングすることなく目視可能な欠陥にフラグを立てる
  • 精密農業:機上ビジョンが圃場ごとに作物ストレス、雑草圧、灌漑問題を区別し、接続が弱い農村地域で常時クラウド接続に頼ることなく農場管理システムへ意思決定をフィードバックする
  • 測量・マッピング:写真測量・点検ドローンが機上またはエッジアプライアンスで画像を処理し、飛行ごとに転送・保存する必要のある生データ量を削減する
  • 公共安全:固定カメラネットワークは継続的な固定クラス検出とトリガー式VLM検索を組み合わせる——例えば、何時間もの映像を手作業で確認する代わりに、記述されたインシデントをアーカイブから取り出す

📌補足: 軍事プログラムもこのシリコン市場を形作っています。Shield AIの自律ソフトウェアHivemindは米空軍のCollaborative Combat Aircraft(CCA)YFQ-44Aプログラムに選定され、Andurilのソフトウェア Latticeは同じ機体でテストされました。この自律性スタックに対するプログラムレベルの需要は、エッジ推論シリコンへの投資を後押しする要因の一つですが、防衛プログラムの認証経路、購入者、要件は上記の商用導入とは根本的に異なり、本ガイドの対象範囲外です。

比較:カメラとドローン向けの演算プラットフォーム

Jetson OrinとJetson Thorの完全な仕様についてはエッジシリコンガイドを参照してください——この表は映像解析に最も関連するカメラ・ドローン特化型プラットフォームに絞っています。

プラットフォーム
電力予算
最適な用途
状況
Hailo-10H / Hailo-155W未満カメラ内蔵GenAI、VLMトリアージISC West 2026で発表
Ambarella NシリーズエッジAIビジョンSoC8Kマルチセンサー認識CES 2026で発表
NVIDIA Jetson Orin / Thor15〜130WクラスマルチカメラエッジアプライアンスThor:最大32台のMIPIカメラ
Qualcomm QRB5165(VOXL 2)ドローンクラスモジュールオートパイロット+VIO+推論PX4対応、約16g

導入に必要なハードウェアは何か?

4つのハードウェアカテゴリがカメラ・ドローンVLMプロジェクトの大半をカバーします。価格は頻繁に変わるため、現在の販売店・ディストリビューターの取り扱いを確認してください。

  • カメラモジュールと開発キット:エッジアクセラレーターと組み合わせたリファレンスカメラボードで、独自のカメラ設計に踏み切る前にカメラ内蔵パイプラインを試作するために使用
  • Hailo M.2アクセラレーターモジュール:M.2スロット経由で既存のカメラや組み込み演算ボードに5W未満のAI推論を追加し、カメラのメインボードを再設計する必要がない
  • エッジ映像アプライアンス:NVIDIA Jetson OrinとJetson Thorの開発キットで、現地アプライアンスのフリートを展開する前に上記のマルチカメラ集約アーキテクチャを試作するために使用
  • ドローン開発プラットフォーム:ModalAI VOXL 2開発キットで、量産機体に統合する前にPX4ベースのオートパイロットと機上推論パイプラインを試作するために使用

オンデバイスではまだ何ができないのか?

3つの能力は2026年時点でクラウドレベルまたは研究段階にとどまっており、今年中にカメラ・ドローンクラスのアクセラレーターがそれを変えることはありません。

  • 長時間の映像理解:トリガー式のクリップ解析ではなく、数時間に及ぶ録画全体を一度に推論することは、エッジアクセラレーターのメモリ・演算予算を依然として超える
  • 大規模なカメラ横断の再識別:記述された被写体を多数のカメラフィードや拠点にわたって確実に追跡することは、マルチカメラのアーカイブ全体にアクセスできる中央集権的システムに依然として適したワークロードのままである
  • 数時間分の映像にわたる大規模コンテキスト:特定のフラグが立てられたクリップではなく丸一日分の録画にわたって推論する必要があるオープンボキャブラリークエリは、エッジアクセラレーターの電力予算が支えるより多くのコンテキストと演算を依然として必要とする

どのような管轄区域・調達ルールが適用されるか?

日本では、国土交通省(MLIT)の航空局が無人航空機情報基盤システム(DIPS)を通じてドローンの登録・飛行カテゴリを管理しており、経済産業省(METI)はAIガバナンスに関する指針を通じて企業のAI導入に関する文脈を提供しています。 日本でカメラ・ドローンプロジェクトを行う場合、DIPSへの機体登録とリスクに応じた飛行カテゴリの区分は形式的な手続きではありません——それによって、追加の許可なく運用できる自律機能(自動検知・対応ロジックなど)が決まります。システムインテグレーターは、ハードウェアと自律機能を仕様化する前に、想定する飛行カテゴリと必要な許可・承認をMLITの枠組みで確認すべきです。

よくある質問

なぜカメラ・ドローンのAIシステムはクラウドではなくオンデバイスで推論を実行するのですか?

プライバシーではなく帯域幅と通信リンクの制約が主な理由です。連続的な4Kカメラストリームは、保存期間全体で見るとローカルで処理するアクセラレーターより転送・保存コストが高く、運用距離にあるドローンはクラウド依存を許容できない断続的で時に妨害を受ける無線リンクを持っています。

固定クラス検出とオープンボキャブラリーVLM検索の違いは何ですか?

固定クラス検出器は、画像に事前学習済みカテゴリセット(典型的なCOCO学習モデルで約80)のいずれかが含まれるかに答えます。オープンボキャブラリーVLMは「積み降ろし場付近に誰かがバッグを置いていったクリップを見つけて」といった記述されたクエリに、固定クラス検出器が一度もカテゴリとして認識するよう訓練されていない内容に対して答えます。

ビジョン言語モデルは5W未満のカメラアクセラレーターでリアルタイムに動作しますか?

全フレームレートでは動作しません。VLMは5W未満の電力予算内でストリームあたり毎秒30フレームでは動作しません。実際には軽量な固定クラス検出器が低電力で常時稼働し、フラグが立てられたクリップのみがオープンボキャブラリー記述のためにVLMへ渡されます——VLMはトリガーされたクリップに対して動作し、全フレームに対してではありません。

商用ドローンは機上AIにどの演算プラットフォームを使っていますか?

Qualcomm QRB5165をベースとしたModalAIのVOXL 2は広く使われるリファレンスプラットフォームです。PX4に対応し、GPSフリー視覚慣性オドメトリによるナビゲーションをサポートし、オートパイロット、演算、ナビゲーションセンサーを約16グラムのモジュールにまとめています。

単一の4Kセキュリティカメラは実際にどれだけの帯域幅を必要としますか?

フレームレート、シーンの複雑さ、コーデックによって異なります——単一の目安の数字に頼るのではなく、このページの帯域幅計算機を使って、ご自身の具体的なカメラ台数、解像度、フレームレート、保存期間について継続的な帯域幅と保存コストを見積もってください。

新しいカメラ設計にはHailo-10HとAmbarella Nシリーズのどちらを選ぶべきですか?

両者は重なりつつも異なる位置を狙っています。Hailo-10HとHailo-15は5W未満のカメラ内蔵GenAI推論に焦点を当てており、Ambarella Nシリーズ(CES 2026で発表)はマルチセンサー認識を備えた8KエッジAIビジョンSoCとして位置づけられています。適切な選択は、目標解像度、電力予算、同じチップ内でのマルチセンサー融合が必要かどうかによって決まります。

なぜドローンにはGPSフリーナビゲーションが必要で、VOXL 2はそれをどう扱いますか?

GPS信号は妨害、なりすまし、あるいは屋内や紛争地域で単に利用できないことがあります。VOXL 2は視覚慣性オドメトリ(VIO)をサポートしており、カメラと慣性センサーのデータを融合して衛星測位に頼ることなく位置と方位を推定します。

日本国内での商用ドローン点検にはどのMLIT飛行カテゴリが適用されますか?

運用内容によります。国土交通省(MLIT)はDIPSを通じて機体登録とリスクに応じた飛行カテゴリを管理しており、インフラ・産業設備点検には多くの場合、特定飛行としての許可・承認が必要です。システムインテグレーターは、ハードウェアと自律機能を仕様化する前に、該当するカテゴリと必要な許可をMLITに確認すべきです。

エッジアプライアンスは必要ですか、それとも各カメラが単独で推論を実行できますか?

拠点あたりのカメラ台数によります。少数のカメラであれば、それぞれが独立してカメラ内蔵推論を実行できます(Hailo-10H/15クラスのチップ)。カメラ台数の多い拠点は通常、フィードを中央で集約する現地のエッジアプライアンス(NVIDIA Jetson OrinまたはThor)の恩恵を受けます——Jetson Thorが1台で最大32のMIPI CSI-2カメラ入力に対応することは、意図されたマルチカメラの役割を示す強いシグナルです。

オンデバイスVLMは映像解析においてまだ何ができませんか?

3つの能力は2026年時点でクラウドレベルまたは研究段階にとどまっています:数時間に及ぶ録画全体を一度に推論する長時間の推論、多数のカメラにわたる被写体の大規模な再識別、そして特定のフラグが立てられたクリップではなく丸一日分の録画にわたるコンテキストを必要とするオープンボキャブラリークエリです。

← ローカルLLM活用 に戻る