重要なポイント
- ロボットの知能は、低速な推論層(VLM/VLA、意思決定レート約1〜10Hz)と高速な制御層(古典制御、100〜1,000Hz)に分かれる——VLAが制御ループを直接閉じるよう求められることはない。
- NVIDIAはIsaac GR00T N1.5がJetson Thorで動作すると明言。同社はまた、Llama・Qwen・DeepSeek(LLM)とQwen2.5-VL・Llama 3.2 Vision(VLM)が言語・シーン記述レイヤー向けに同じボードで動作するとも述べている。
- Google DeepMindはGemini Robotics On-Deviceをインターネット接続なしでローカルに動作するよう特化して設計——オンロボット推論が研究上の興味ではなく、今や第一級の導入目標であることを示す最も明確な兆候。
- VLAでロボットが何をできるかを決める制約は、使用するカメラ数とハードウェアに対するモデルの到達可能な意思決定レートであり、アクセラレータの最大TOPS値ではない。
- 安全定格の停止機能やその他の認証済み安全機能は、決定論的でモデルを介さないロジックにとどまる——これは技術的必然性(ニューラルネットワークは形式的に検証できない)であると同時に、我々自身によるEU機械規則の適用範囲の解釈では、コンプライアンス負担を軽減する選択でもある。ただしこれは規制当局が公表した特定のガイダンスに基づくものではない。
- 自律移動ロボット(AMR)や農業機械は今日すでに商業規模の自律性を運用している。ヒューマノイドは注目を集めるが、本記事で扱うクラスの中で最も導入台数が少ない。
- SmolVLA(約4億5000万パラメータ)は低電力ターゲット向けの現実的なオープン選択肢。OpenVLA(70億)は一般的な学術ベースラインであり、低レイテンシの搭載選択肢ではない。
「ロボット上のAI」が実際に分解される内容
ロボットのソフトウェアスタックには少なくとも5つの異なる仕事があり、そのうち今日LLMやVLAにとって現実的な領域なのは2つだけです。 「ロボティクスにおけるAI」を未分化な一塊として扱うことが、この分野の報道における最も一般的な枠組みの誤りです——それは誤った問い(「LLMを動かせるか」)へと導き、有用な問い(「これら5つの仕事のうちモデルが実際に担っているのはどれで、どのレートか」)を見失わせます。
データが流れる順に並べた5つの仕事:知覚(カメラ・ライダー・IMUデータを構造化された世界表現に変換)、状態推定(そのデータを時間軸で融合し、ロボット自身の姿勢と世界状態の安定した推定を得る)、タスク計画(次に*何を*するか決める——「青いカップを取る」「積み込み場へ移動する」)、動作計画(タスクを実行可能な軌道に変換する——関節角度、経路、把持アプローチ)、制御(計画された軌道を、外乱を打ち消しながら瞬間ごとにモーター指令へ変換)。
知覚はVLMや軽量ビジョンモデルがすでに実際の仕事をこなしている領域です——物体検出、シーン記述、意味的ラベリング——通常カメラ映像が生み出す5〜30Hzの範囲で動作します。タスク計画はVLAやLLMが真の価値を発揮する領域です:自然言語または視覚的な目標を、下流のシステムが行動できる記号的サブゴールに変換します。この2つが、本記事がVLA/LLMの正当な領域と扱う仕事です。
状態推定・動作計画・制御は種類が異なります。状態推定は通常カルマンフィルタやパーティクルフィルタを使います——決定論的でよく理解された数学であり、コア推定問題においてニューラルネットワークが改善するものではありません。動作計画は古典的な軌道最適化手法(CHOMP、RRT*、MPCベースのプランナー)が主流です。これは検証可能な制約充足を提供できるからであり、これは言語モデルの出力には備わっていない特性です。制御は最も高速でモデルに最も適さない層です——トランスフォーマーのフォワードパスでは到達し得ないレートで、センサー誤差に対するフィードバックループを実行します。
📍 一文で説明
ロボットのソフトウェアスタックの5段階——知覚、状態推定、タスク計画、動作計画、制御——のうち、今日LLMやVLAにとって現実的な領域は知覚とタスク計画のみである。
💬 簡潔に説明
知覚=「何を見ているか」。状態推定=「今どこにいるか」。タスク計画=「次に何をすべきか」。動作計画=「どうやってそこに着くか」。制御=「今すぐモーターを動かす」。VLAは1つ目と3つ目に存在し、残りは古典的で決定論的なコードが担う。
ロボットのソフトウェアスタックのどの部分をLLMやVLAが実際に置き換えられますか?
知覚(シーン記述、物体識別)とタスク計画(目標をサブゴールに変換すること)です。状態推定・動作計画・制御は古典的なまま——それぞれカルマン/パーティクルフィルタ、軌道最適化、フィードバック制御ループ——です。これらはモデルの出力が提供できない決定論的で検証可能な挙動を必要とするためです。
制御レートの現実チェック
VLAでロボットが何をできるかを決める制約は、モデルが到達可能な毎秒の意思決定数であり、アクセラレータの最大TOPS定格ではありません。 100 TOPSを謳うハードウェアデータシートは、20〜70億パラメータのVLAが1秒間に何回完全なフォワードパスを実行し使用可能なアクションを生成できるかについて何も語っていません。この数値はモデルサイズ、量子化、バッチサイズ、カメラ数、メモリ帯域幅が組み合わさって決まり、通常、シングルストリームで低レイテンシのワークロードに対してTOPS値が示唆する値をはるかに下回ります。
ループによって許容されるレイテンシは大きく異なります。歩行型または自己バランス型ロボットのバランスループは、1桁ミリ秒単位の補正を必要とします——これは100〜1,000Hzの制御ループであり、公開されているVLAアーキテクチャでこのレートで動作するものはありません。マニピュレーションのタスク計画ループ(「カップに手を伸ばす」か「ボウルに手を伸ばすか」を決める)は、挙動を目に見えて劣化させることなく100〜1,000ミリ秒のレイテンシを許容します——これがVLAが現実的に動作する1〜10Hzの範囲です。ナビゲーションレベルの再計画ループ(障害物を避けて経路変更する)は、多くの場合数秒の遅延を許容します。
だからこそ、モデルの根底にあるFLOPsではなく、モデルの出力レートこそが予算化すべき数値です。パラメータ数が似た2つのVLAでも、パイプライン(ビジョンエンコーダ、アクションデコーダ、トークン化)のどれだけが1回の意思決定あたりのクリティカルパス上にあるかによって、到達可能なHzは大きく異なります。また、同じフォワードパスに供給されるカメラストリームの数によっても異なります。ほとんどのVLAアーキテクチャは追加のカメラを追加の並列性としてではなく、追加のコンテキストとして処理するためです。
制御ループ内のモデルは、パフォーマンスだけでなく安全性の問題でもあります。 ニューラルネットワークの出力は、PIDやMPCコントローラの安定余裕のように形式的に検証可能ではありません——トランスフォーマーが未知の入力分布に対して安全でないアクションを決して生成しないという証明は存在しません。これが、我々が把握している限りすべての実運用ロボットスタックにおいて、推論層のモデルがどれだけ高性能になろうとも、安全定格の停止機能・トルク制限・衝突回避インターロックが決定論的な制御コードにとどまり続ける根本的な理由です。認証可能な安全機能は網羅的に特性評価可能な挙動を必要としますが、大規模なニューラルネットワークは現状その保証を提供できません。
- バランス/移動制御ループ:100〜1,000Hzが必要——古典制御にとどまり、VLAでは決してない
- マニピュレーションのタスク計画ループ:100〜1,000ミリ秒のレイテンシを許容——VLAの現実的な動作範囲
- ナビゲーション再計画ループ:多くの場合数秒を許容
- カメラ数はほとんどのVLAアーキテクチャで意思決定あたりの作業量を倍増させる——同じ意思決定レートでも4カメラ構成は1カメラ構成に対して「無料」ではない
- 安全定格の停止機能とトルク制限は業界全体で決定論的でモデルを介さないロジックにとどまる——これは我々が引用できる特定の規制上の義務ではなく、認証可能な安全機能要件の直接的帰結(規制の背景セクション参照)
より大きく高性能なVLAが制御ループを直接実行できないのはなぜですか?
独立した2つの理由があります。第一にレイテンシ:制御ループには100〜1,000Hzの補正が必要ですが、数十億パラメータのモデルのフォワードパスは——量子化済みでも専用アクセラレータ上でも——それより桁違いに遅いです。第二に検証可能性:認証された安全機能(非常停止、トルク制限)は事前に網羅的に特性評価可能な挙動を必要としますが、ニューラルネットワークの出力空間は現状、PIDコントローラの安定余裕のようには検証できません。
TOPSはVLAワークロード向けにハードウェアを比較する良い方法ですか?
単独では不十分です。TOPSは理論上の最大スループットを測定しますが、意思決定レートが到達可能かどうかを決定するのは、使用する具体的なモデル・量子化・カメラ数における毎秒の意思決定数です。これはメモリ帯域幅と、パイプラインのどれだけが意思決定あたりのクリティカルパスにあるかに大きく依存し、生の計算能力だけではありません。
ロボットの推論予算を見積もる
以下の計算ツールを使って、特定のハードウェア/カメラ数の組み合わせが実際に到達できる意思決定レートを、モデルやボードを決定する前に見積もってください。 これらの推定値は初期予算策定のための技術的な近似であり、ベンダーのベンチマークではありません——設計を確定する前に実際のモデルとハードウェアで検証してください。
Estimated slow-tier inference budget
Achievable frequency: 15.0 Hz
Headroom: +10.0 Hz — This fits the onboard slow-reasoning tier. The fast control loop (100–1,000 Hz) still needs to run in classical control code, not through this model.
VLAモデル比較:何がオープンで、何がどこに適合するか
5つのVLAモデルが、ロボティクスチームが2026年に評価するオープン・準オープンな領域の大半をカバーし、加えて分野の方向性を追う価値のあるアクセス制限付きモデルが1つあります。 以下で「〜」が付いたパラメータ数は、一次のベンダー仕様書ではなく二次情報源に基づくものです——正確な値ではなく方向性の目安として扱ってください。
NVIDIA Isaac GR00T N1とその改訂版N1.5は、ヒューマノイド向けのVLAモデルで、オープンに公開されており、パラメータ数は約〜22億(二次情報源)です。NVIDIAはGR00T N1.5が自社のJetson Thorボードで動作すると明言しています——これは推測ではなくベンダー確認済みの搭載目標です。
Physical Intelligenceのπ0(パイゼロ)は、フローマッチング型VLAで、パラメータ数は約〜30億(二次情報源)、オープンウェイトで公開され、PaliGemma系のビジョン言語バックボーン上に構築されています(この詳細も二次情報源)。以前のVLA設計と比較して滑らかで高頻度なアクション生成が注目されています。
OpenVLAは70億パラメータで、VLA研究における一般的な学術ベースラインです——オープンで文書化が充実しており、広くベンチマーク対象になっています。そのサイズは「有能なVLAはどれだけ大きくあるべきか」の基準点となりますが、タイトな搭載レイテンシ予算に対しては通常第一選択ではありません。
Google DeepMindのGemini Robotics On-Deviceは、パラメータ数が非公開でアクセスも制限/パートナー限定です——現時点でほとんどのチームが利用できる選択肢ではありません。それでも追う価値がある理由は、Google DeepMindがインターネット接続なしでロボット上でローカルに動作するよう明示的に設計したと述べている点です。これは、オンロボット推論がクラウドファーストシステムに後付けされた研究的余談ではなく、今や第一級の導入目標であることを示す、大手研究所からの最も明確な兆候です。
SmolVLAは、パラメータ数が約〜4億5000万(二次情報源)のコンパクトなオープンVLAです——2〜70億パラメータモデルのメモリフットプリントとフォワードパスのレイテンシが予算に単純に収まらない、真に低電力なターゲットハードウェア(フルサイズのJetson系ボードではなく小型アクセラレータ)向けの現実的な選択肢です。
OctoとRT-2は世代の古いVLAアーキテクチャで、主にこの分野が現在のフローマッチングやトークン化アクション設計にどう至ったかを歴史的に把握するのに有用です——2026年の導入判断における現行の推奨ではありません。
VLAカテゴリを超えて、NVIDIAは汎用のLlama・Qwen・DeepSeek(LLM)、およびQwen2.5-VL・Llama 3.2 Vision(VLM)がJetson Thorで動作すると述べています。これらは、フルサイズのVLAが不要なロボットスタックにおける言語理解とシーン記述レイヤーを担います——口頭の質問に答えるサービスロボットや、テキストラベルを読み取るマニピュレーションアームは、アクション出力モデルをまったく必要としません。
モデル | パラメータ | アクセス | 搭載ターゲット |
|---|---|---|---|
| Isaac GR00T N1 / N1.5 | 〜22億(二次) | オープン | Jetson Thor(NVIDIA確認済み) |
| Physical Intelligence π0 | 〜30億(二次) | オープンウェイト | Jetson系ボード |
| OpenVLA | 70億 | オープン | AGX Orin/Thorクラス |
| Gemini Robotics On-Device | 非公開 | 制限/パートナー限定 | 設計上ローカル(インターネット不要) |
| SmolVLA | 〜4億5000万(二次) | オープン | 低電力アクセラレータ |
| Octo / RT-2 | 様々 | オープン(研究用) | 歴史的参照のみ |
ハードウェア階層の詳細(Hailo-10H、Jetson Orin Nano/NX、AGX Orin、AGX Thor——電力エンベロープと価格帯)については、ここで仕様を再導出するのではなくローカルLLM向けエッジAIハードウェアを参照してください——本記事は何がどこで動くかに焦点を当てており、シリコン自体には焦点を当てていません。
ロボティクスの文脈でVLAとVLMの違いは何ですか?
VLM(ビジョン言語モデル)は画像とテキストを入力として受け取り、テキストを出力します——シーン記述、回答、ラベルなどです。VLA(ビジョン言語アクションモデル)は同じ入力を受け取りますが、ロボットのアクション——目標姿勢、関節軌道、把持点——を出力します。ロボットスタックは知覚/シーン理解レイヤーにVLM、タスク計画レイヤーにVLAを使うことが多く、自律的なアクションが不要な場合はVLMだけで済むこともあります。
OpenVLAはレイテンシに敏感な搭載展開に適した選択肢ですか?
それは70億パラメータの標準的な学術ベースラインであり、タイトな搭載レイテンシ予算に対してはIsaac GR00T N1.5(〜22億、二次情報源)やSmolVLA(〜4億5000万、二次情報源)のような専用設計の代替と比べて重くなります。新しく小さいモデルをベンチマークする際の文書化された参照点としては有用であり続けます。
統合レイヤー:ROS 2、TensorRT、そして引き継ぎ
ROS 2は、ほとんどの実運用ロボットスタックにおいて、低速な推論層と高速な制御層の間の実務的な境界です。 VLAノードは目標姿勢・サブゴール・把持点といったタスクレベルの意図をROS 2メッセージとして発行し、別の古典的な制御ノードがそのメッセージを購読し、制御ループのレートで実行します。VLAはモーターに直接話しかけることは決してなく、トピックに向けて発言し、そのトピックより下流のすべてを決定論的なノードが所有します。
NVIDIAハードウェア(Jetson OrinおよびThorクラス)では、TensorRTとTensorRT-LLMが、量子化されたVLAやLLMを到達可能な推論レートに導く標準的なランタイム経路です——カーネル融合、精度キャリブレーション(FP8/INT8/INT4)、そして単純なPyTorch推論ループでは活かされないハードウェア固有の最適化を行います。このステップを省くことが、「理論上は」目標Hzに到達すべきモデルが実際には到達しない最も一般的な理由です。
NVIDIAベースではない小型の搭載ターゲット——Hailo-10Hアクセラレータやコンパクトなarmベースのボード——では、ExecuTorchとllama.cppが言語/知覚コンポーネント向けの妥当なランタイム経路です。どちらも今日そのままフルVLAランタイムとして使えるわけではありません。これらの小型ボードを狙うチームは、フルVLAよりもコンパクトなVLM(知覚/シーン記述向け)を動かすことが多く、タスク計画はルールベースのロジックに単純化するか、より小型のアクセラレータが維持できる頻度でより低頻度に実行します。
実務的な統合パターンを順に示すと:(1)VLA/VLMノードは到達可能なHzで非同期に動作し、意図をROS 2トピックへ発行する。(2)古典的なプランナーがそれを購読し、意図を軌道に変換する。(3)制御ノードが100〜1,000Hzで軌道を実行し、独自のセンサーフィードバックループを使い、行動のために次のVLA出力を待つことは決してない。VLAノードが停滞または遅延した場合、制御ノードは最後の有効な軌道の実行を継続するか、安全に位置を保持する。低速層をブロックすることはない。
- 1VLA/VLMノードは非同期に動作する
Why it matters: 独自の到達可能なレート(1〜10Hz)でタスクレベルの意図をROS 2トピックへ発行する——制御ループのクリティカルパス上に置かれることは決してない。 - 2古典的なプランナーがその意図を購読する
Why it matters: 決定論的な動作計画コードを使い、サブゴール(「カップに手を伸ばす」)を具体的で制約検証済みの軌道に変換する。 - 3制御ノードが独立して軌道を実行する
Why it matters: 独自のセンサーフィードバックとともに100〜1,000Hzで動作し、次のVLA出力を決して待たない——低速層が停滞した場合、高速層は位置を保持するか最後の有効な計画を継続する。 - 4NVIDIAターゲット上でTensorRT/TensorRT-LLMで量子化・コンパイルする
Why it matters: カーネル融合と精度キャリブレーション(FP8/INT8/INT4)は、モデルの理論上のHzと実際に達成されるHzの差を左右することが多い——このステップを省くことが搭載推論のパフォーマンス不足の最も一般的な原因である。 - 5非NVIDIAの小型ターゲットでは、フルVLAではなくVLMにワークロードを絞り込む
Why it matters: ExecuTorchとllama.cppはコンパクトなボード上での言語/知覚ランタイム経路をカバーするが、今日主流の低電力ランタイムでこれらの電力エンベロープでフルVLAを実用的にできるものはない。
VLAモデルはロボットのモーターに直接話しかけますか?
いいえ。実運用スタックでは、VLAノードがタスクレベルの意図(目標姿勢、サブゴール)をROS 2トピックへ発行します。別の古典的な制御ノードがそのトピックを購読し、制御ループのレートでモーター指令に変換します。VLAがモーター指令の経路に入ることは決してありません。
VLAノードが遅延または停滞した場合どうなりますか?
高速な制御層はそれを待ちません。独自のセンサーフィードバックループを使い、最後の有効な軌道の実行を継続するか安全な位置を保持します。推論層のペースとは独立しています——このデカップリングこそが、そもそも二層アーキテクチャが使われる理由です。
機械クラス別の導入実態
倉庫内の自律移動ロボット(AMR)と農業機械が、今日のロボット自律性の導入実態を代表しています——ヒューマノイドはメディアの注目を集めますが、本記事で扱う機械クラスの中で最も導入台数が少ないものです。 このギャップは、エンジニアリングの時間をどこに投資するか決める人にとって重要です。最も計算負荷が高く最も話題になるロボットカテゴリは、実際に現場で稼働している台数が最も少ないカテゴリでもあります。
ヒューマノイドは最も計算負荷が高く、最も導入が少ないクラスです。最も多くのセンサーと自由度を搭載し、それに応じて最も重い推論層のワークロード(複数カメラストリーム、全身のタスク計画)を抱えています。だからこそ、最新かつ最も高性能な搭載シリコン(Jetson Thor)と最新のVLAアーキテクチャ(GR00T N1.5)の主要ターゲットなのです。今日の導入台数は、受けている注目に比べれば小さいものです。
自律移動ロボット(AMR)——倉庫で在庫を移動させる車輪型ロボット——は何年も前から商業的に有意義な規模で導入され、古典的なナビゲーションと障害物回避スタックを動かしています。2026年に変わりつつあるのは、すでに成熟した自律性スタックの上に言語/ビジョンのインターフェース層を追加することです。シーン記述用のVLAや、人間が自然言語で指示を与えられる軽量なタスク計画層であり、既存のナビゲーションロジックを丸ごと置き換えるものではありません。
固定式製造セル内の産業用アームは、これら両極の間に位置します。動作計画と制御は通常、何十年も前から完全に古典的なままです(溶接やピック・アンド・プレースのアームは、教示された軌道を繰り返すのにVLAを必要としません)。しかし、知覚レイヤー——欠陥検出、部品識別——は軽量なビジョンモデルの利用が増えています。固定位置のカメラと制約されたタスクにより、フルVLAなしでも十分な、より小さく目的特化したモデルで足りるためです。
農業機械は、「AIロボティクス」の報道で最も見落とされがちな導入クラスですが、現在のVLAの波よりずっと前から、GPS誘導ステアリングやトラクター・収穫機の障害物検出といった商業的自律性を何年も前から大規模に導入しています。今追加されつつあるのは、AMRと同じパターンです。作物や雑草の識別、自然言語によるオペレーター指示といった言語/ビジョンのインターフェース層を、すでに自律的で古典的なナビゲーション・制御システムの上に載せるという形です。
- ヒューマノイド:単位あたりの計算負荷が最も高く、最新のVLAアーキテクチャを搭載するが、今日最も導入台数が少ない
- AMR(倉庫):何年も前から成熟した古典的自律性スタック。VLM/VLAの追加はインターフェース層であり置き換えではない
- 産業用アーム:動作/制御は何十年も前から完全に古典的。軽量ビジョンモデルが追加されつつあるのは知覚レイヤー
- 農業機械:現在のVLAの波以前から、GPS誘導・障害物検出といった商業的自律性が大規模に導入済み
今日どのロボットクラスが実運用で最も多くのVLAモデルを稼働させていますか?
いずれのクラスも、意味のある規模の実運用でVLAを主要な制御メカニズムとして稼働させてはいません——AMRと農業機械は成熟した古典的自律性スタックを稼働させており、VLM/VLAの追加はインターフェース層(シーン記述、自然言語コマンド)に限定されています。ヒューマノイドは最新のVLA統合ターゲットですが、ここで扱うクラスの中で導入台数が最も少ないものです。
購入ガイド:実際に何を探すべきか
3つのハードウェアカテゴリが、オンロボット推論構築の大半をカバーします。推論層向けのJetson系開発キット、知覚入力向けの1台以上の深度/ステレオカメラ、そしてすべてを搭載するロボット開発プラットフォームです。 このセクションではカテゴリのみを示し、具体的な型番・価格・ベンダーの主張は示しません——両方とも記事が追跡できるより速く変化するため、購入前に各ベンダーで最新の仕様と価格を直接確認してください。
Jetson OrinおよびJetson Thor開発キットは、搭載VLAまたはVLMを評価するための標準的な出発点です——電力エンベロープと相対的な計算能力を含む階層別の内訳(Orin NanoからAGX Thorまで)についてはローカルLLM向けエッジAIハードウェアを参照してください。
深度またはステレオカメラは、VLAの標準的な知覚入力です——公開されているVLA研究とベンダーのリファレンスデザインの大半は、単眼RGBのみではなくRGB-Dまたはステレオ入力を前提としています。深度情報が、アクション出力レイヤーが依存する把持点と障害物距離の推定を単純化するためです。
ロボット開発プラットフォーム——ゼロからの機械的な組み立てではなく、車輪型またはアーム型のリファレンスプラットフォーム——は、カスタムハードウェアに踏み切る前にVLA統合を検証するチームにとって実務的な出発点です。
- Jetson Orin/Thor開発キット——推論層の計算ターゲット
- 深度/ステレオカメラ——VLAの標準的な知覚入力
- ロボット開発プラットフォーム(車輪型またはアーム型のリファレンスキット)——カスタムハードウェア前に統合を検証
機体外にとどまるもの
積極的にローカルファーストなアーキテクチャであっても、4つのワークロードはロボットの外にとどまります:フリート学習、モデル更新、ロボット間コンテキスト共有、そして重量級シミュレーションです。 いずれも知覚やタスク計画のようにレイテンシに敏感ではなく、いずれも単一のロボットではアクセスできない計算資源とデータの恩恵を受けます。
フリート学習——多数の導入済みロボットの経験を集約して共有ポリシーやモデルを改善すること——は本質的に単一のロボットが持つより多くのユニットからのデータを必要とし、関わる学習用計算資源は搭載アクセラレータの予算や用途をはるかに超えます。
モデル更新(新しいVLAチェックポイント、微調整済みの知覚モデル)はロボット上で学習されるのではなく、ロボットに向けてプッシュされます。ロボットは今日使われているほぼすべての実運用導入パターンにおいて、学習ノードではなく推論ターゲットです。
ロボット間コンテキスト——あるロボットが同じフリート内の別のロボットが直前に観測した内容から恩恵を受けること——は共有バックエンドを必要とします。あるロボットが別のロボットのセンサー履歴に直接アクセスできる有用な搭載メカニズムは存在しないためです。
重量級シミュレーション——学習データ生成や導入前のポリシー検証に使われる大規模な物理・レンダリングワークロード——は、フリート学習と同じ理由でデータセンター級の計算資源上で実行されます。計算予算に搭載機器での同等物が存在しないためです。
- 多数の導入済みユニットにわたるフリート学習
- ロボットへプッシュされるモデル/チェックポイント更新
- ロボット間コンテキストとフリート共有状態
- 学習データ生成とポリシー検証のための重量級シミュレーション
規制の背景:EU AI法と機械規則
EUでは、機械の安全部品として機能するAIコンポーネントはEU AI法の下でハイリスクとして扱われ、EU機械規則(2023/1230)——2027年1月から適用——はAI駆動の安全機能を持つ機械に対して別途適合性評価を要求します。 安全機能の経路にモデルが介在するロボットは、一方だけでなく両方の枠組みを満たす必要がある可能性があります。
以下は公表された規制ガイダンスではなく、我々自身の論理的分析です。本記事全体で説明している二層アーキテクチャ——安全機能(非常停止、トルク制限、衝突インターロック)を決定論的な古典的制御コードにとどめ、VLA/LLMの推論層を安全機能を直接ゲートしない助言的またはタスクレベルの役割に限定すること——は、適合性評価の負担をおそらく軽減します。なぜなら、認証可能な安全機能は事前に網羅的に特性評価可能な挙動を必要とし、決定論的コードはそれを提供できますが、大規模なニューラルネットワークは現状それを提供できないためです。この枠組みを確認する特定のガイダンスを規制当局が公表しているとは我々は認識していません。これはコンプライアンスの保証ではなく、自身の法律顧問とともに評価すべき技術・コンプライアンス上の論点として扱ってください。
これは法的助言ではありません。適合性評価の範囲、適用される整合規格、および特定のロボットの安全機能の分類は、実際のシステム設計と販売先の法域に依存します——特定製品のコンプライアンス判断を行う前に、資格を持つ法律・規制の専門家にご相談ください。日本国内での導入にあたっては、経済産業省のAIガバナンス関連指針も参照する価値があります。
ロボットの安全機能をAIモデルの外に置くことでEUのコンプライアンスは保証されますか?
いいえ。それは適合性評価が一般に決定論的コンポーネントと非決定論的コンポーネントをどう扱うかに基づく、妥当な技術・コンプライアンス戦略ですが、EU AI法および機械規則(2027年1月から適用)に基づく正式な適合性評価の代替にはなりません。また、我々はこれを公式な規制ガイダンスとして引用しているわけではありません。特定製品については資格を持つ法律顧問にご相談ください。
よくある質問
70億パラメータのモデルはロボット上でリアルタイムに動作できますか?
タスクにとって「リアルタイム」が何を意味するかによります。OpenVLAのような70億パラメータのVLAは、Jetson AGX OrinやThorのような性能の高い搭載ハードウェア上でタスク計画のレート(約1〜10Hz)で動作できます——これは「カップに手を伸ばす」と決めるためのリアルタイムです。バランスや移動制御ループが必要とする100〜1,000Hzでは動作できませんし、そもそもそれは求められていません。そのループは古典的な制御コードにとどまります。
VLAとロボット上でLLMを動かすことの違いは何ですか?
LLM(またはVLM)は言語やビジョンを処理してテキストを出力します——シーン記述や口頭コマンドへの応答に有用です。VLA(ビジョン言語アクションモデル)は目標姿勢・軌道・把持点といったロボットのアクションを直接出力します。多くのロボットスタックは両方を使います:言語理解とシーン記述にLLM/VLM、目標を具体的なアクションに変換するのにVLAです。
どの搭載ハードウェアがIsaac GR00T N1.5を動かしますか?
NVIDIAはGR00T N1.5が自社のJetson Thorボードで動作すると明言しています——これはベンダー確認済みの導入ターゲットです。Jetson Thorは、NVIDIAによれば汎用のLLM(Llama、Qwen、DeepSeek)とVLM(Qwen2.5-VL、Llama 3.2 Vision)も、フルVLAが不要な言語/シーン記述レイヤー向けに動作させます。
なぜロボットはすべてに単一のモデルを使わないのですか?
タスクが互いに相容れないレイテンシと検証可能性の要件を持つためです。タスク計画は100〜1,000ミリ秒のレイテンシを許容し、大きく柔軟なモデルの恩恵を受けます。制御は100〜1,000Hzを必要とし、安全定格機能のために形式的に特性評価可能な挙動を必要とします——これは現行の大規模ニューラルネットワークがどれも満たせない要件です。スタックを低速な推論層と高速な制御層に分割することが、実運用ロボットが両方の要件を同時に満たす方法です。
SmolVLAは実際の製品にとって現実的な選択肢ですか、それとも研究上のおもちゃにすぎませんか?
それは低電力ターゲット——2〜70億パラメータモデルのメモリフットプリントとフォワードパスのレイテンシに対して制約が大きすぎるアクセラレータ——に特化した現実的なオープンの選択肢として位置付けられています。約〜4億5000万パラメータ(二次情報源)という数値は、Jetson AGXクラスより小さいハードウェアを狙うチームにとって、純粋な研究デモンストレーションではなく本物の技術的トレードオフです。
Gemini Robotics On-Deviceは、今日自分のロボット向けにライセンスできることを意味しますか?
必ずしもそうではありません。Google DeepMindはこれを制限/パートナー限定アクセスと説明しており、パラメータ数は非公開です。検証可能なのは設計意図です。Google DeepMindは、インターネット接続なしでロボット上でローカルに動作するよう構築されたと述べており、この特定のモデルにまだアクセスできないチームにとっても、この分野が向かう方向を示すシグナルとなります。
Jetson Orin NXはVLAレベルの推論に対して現実的に何台のカメラストリームをサポートできますか?
モデルと目標とする意思決定レートによります——ほとんどのVLAアーキテクチャは、追加のカメラを個別に並列化可能なストリームとしてではなく、フォワードパスあたりの追加コンテキストとして扱うため、カメラを追加すると到達可能なHzはほぼ比例して低下し、無料ではありません。設計を確定する前に、このページの推論予算計算ツールを使って特定のハードウェア/カメラ/モデルの組み合わせについて見積もってください。これは技術的な見積もりであり、ベンダーのベンチマークではありません。
安全定格の非常停止がVLAモデルを経由することはありますか?
我々が把握している限り、実運用ロボットスタックではありません。安全定格の停止機能・トルク制限・衝突インターロックは決定論的で認証済みの制御ロジック内で動作します——ニューラルネットワークの出力空間は現状、古典的コントローラの安定余裕のように網羅的に検証することができません。これが、推論層のモデルがどれだけ高性能になろうとも、この分離が維持される根本的な技術的理由です。
タスク計画にのみVLAを使い、安全機能には決して使わないロボットにEU AI法は適用されますか?
特定のシステムによっては、それでも適用される可能性があります——機械の安全部品として機能するAIに対するEU AI法のハイリスク分類は、システム内でのAIの役割に関するものであり、EU機械規則(2023/1230、2027年1月から適用)には独自の適合性評価トリガーがあります。これは法的助言ではありません。特定製品の分類については資格を持つ専門家にご相談ください。
関連記事
- ローカルLLM向けエッジAIハードウェア — 本記事全体で参照しているハードウェア階層(Hailo-10H、Jetson Orin Nano/NX、AGX Orin、AGX Thor)
- ドローン・エッジカメラ向けVLA映像解析 — 本記事のアクション側の焦点に対する観測側の対となる記事。同じシリコンを共有しつつ異なるレイテンシ制約を持つ
- ベストなローカルLLM 2026 — 本記事が扱うロボティクス特化のVLAモデルを超えた、一般的なローカルLLMモデルの全体像
- ローカルビジョンモデル:LLaVAとOllama 2026 — ロボティクスの文脈を離れたローカルでのビジョン言語モデルの実行
