VLAとは何か

Physical AI は、カメラ画像と言葉を理解するだけでなく、身体の状態を読み、時間制約の下で行動を出し、物理世界から次の観測を受ける系である。VLA(Vision-Language-Action)は、視覚・言語・行動を一つの方策に結ぶ研究の呼び名だ。RT-2はウェブ由来の視覚言語知識をロボット行動へ移す方向を示し、OpenVLAはこの種の研究をオープンなモデルとして検討可能にした。だが VLA は「画像を見て正しいモーター値を一回出す箱」ではない。カメラ、座標系、関節、遅延、接触、非常停止まで含む閉ループの一部である。

  1. 1人の目的
  2. 2言語のタスク条件
  3. 3知覚(画像・深度・状態)
  1. 1知覚
  2. 2座標と世界モデル
  3. 3方策/VLA
  4. 4行動チャンク
  1. 1行動チャンク
  2. 2低レベル制御器
  3. 3ロボットと物理世界
  4. 4次の観測
  1. 1安全監視・停止条件
  2. 2いつでも行動を拒否/停止
順序と役割を、ひとつずつ分けて考える

歴史を「何を接続したか」で読む

古典的なロボットは、物体姿勢を推定し、逆運動学で手先の目標を関節角へ変換し、軌道追従制御器で動かす。明示的で検証しやすい一方、照明、物体、言い回しが変わるたびに認識器やルールの手当てが要る。模倣学習は人の遠隔操作などから観測→行動の対応を学び、この設計負荷を減らした。しかしデータ分布外に弱く、成功例だけの収集では失敗から戻る方法が学べない。

Transformer と視覚言語モデルの進展により、言葉と多様な画像の表現を行動学習へ接続する VLA が現れた。OpenVLA 論文は公開データとオープンソース VLA を提示するが、公開重みがあること、商用利用できること、あるロボットで安全に動くことは別の確認事項である。近年の焦点は、巨大化だけでなく、異なる身体・データ・シミュレーションをどう混ぜ、現実の遅延や失敗に耐えるかへ移っている。

四つの座標を混ぜない

初心者がつまずくのは「右へ」の基準である。画像座標はピクセル、カメラ座標はレンズ中心からの三次元、ロボット基準座標はベースからの位置、手先座標はグリッパ中心から見た位置だ。キャリブレーションはこれらの変換を定める。VLA が高レベルの行動を提案しても、低レベル層は到達可能性、関節範囲、速度、衝突を確認しなければならない。画像で取れそうに見える物体が、腕の可動域にあるとは限らない。

何がすごく、何が未解決か

言語を条件として加えると、個別にプログラムしていない目的の組合せを扱える可能性がある。複数カメラと状態履歴を使えば、部分的な遮蔽や途中変化を観測し直せる。だが、これは因果的に世界を理解した証明ではない。学習データに似た背景、物体、速度、カメラ位置での相関を拾っている場合もある。安全性の主張には、成功率だけでなく、失敗時の停止、接触力、復帰、未知物体、照明差、通信遅延の測定が要る。

VLA を使う場面は、変動する物体を扱う反復作業、自然言語でタスクを指定したい研究、遠隔操作データからのスキル学習である。ミリ秒級で決定論が必要なモータ制御、法規や人命に直結する判断、訓練データの根拠が要求される場面を、一つの end-to-end 方策だけに委ねるのは不適切である。

演習:身体を持たないまま分解する

ロボットを接続せず、机上の「赤いブロックを青い箱の左に置く」を紙か図で分解する。必要な観測、各座標、成功条件、停止条件、失敗後に再観測する条件を列挙する。次に VLA に任せたい曖昧さと、コード・制御器に残す制約を色分けする。これは未実行の設計演習であり、実機の安全性を検証したものではない。この境界を最初に書けることが、後のデータ収集より重要である。

observation と action をデータとして読む

一エピソードを episode_id, frame_index, timestamp_ns, observation.images.front, observation.state, action, task として考える。observation.images.front はその時刻の視覚、observation.state は関節位置・速度・グリッパ状態などの数値、action は次の制御周期または action chunk で命令する値である。LeRobot が説明する形式では視覚は MP4/画像、state/action は Parquet に格納され得る。LeRobot READMEの形式は便利な共通語だが、各 feature の単位、並び順、周波数を自分のデータカードに必ず書く。

例えば state=[0.2, -0.1, 0.7, 0.0] を「x,y,z,グリッパ」と決めたとしても、0.2 が m なのか正規化値なのか、z の原点が机かベースか、グリッパの 0 が開か閉かで意味が反転する。action=[0.01,0,0,-0.2] が位置増分なら 1cm 前進だが、速度なら 1 秒後には別の距離になる。論文の action token や正規化済み値をそのまま既存コントローラへ渡さない。

漏洩を見つけるチェック

train/eval を frame 単位でランダム分割すると、同じ物体・同じ背景・連続した手の動きが両方に入り、記憶を一般化と誤認する。最低でも episode 単位、可能なら収集日、物体セット、操作者単位で group split する。チェックには episode_id の集合積が空か、画像ファイルの perceptual hash が別 split に重複しないか、task 文が完全一致し過ぎないか、test のタイムスタンプが train 後かを使う。最終テストを可視化してエラー修正に使ったら、そのセットは locked ではなく validation に格下げする。

実機を用いない検証として、10 episode の架空 CSV を作り、3 episode を test として丸ごと隔離する。意図的に一枚のフレームを複製して train と test に入れ、hash 検査が止めることを確認する。データ処理が「きれいに完走する」より、悪い分割を拒否できることを先に評価しよう。

最後に、VLA の出力を受ける層を状態機械として描く。observe → validate → propose → constrain → execute/stop → observe の各遷移に、必要な入力と拒否条件を置く。例えば画像が欠ければ validate で止まり、可動域外なら constrain で止まる。これを紙上で10回追跡し、どの状態でも「前回の action を無期限に繰り返す」遷移が無いかを確かめる。これは実装済み制御器の検証ではなく、閉ループの安全要求を先に明文化する演習である。

2024〜2026の系譜:action interface は依然として契約である

2024年にopen modelが広がってVLAは検査しやすくなったが、interfaceの境界は消えない。各episodeについて、camera timestamp、proprioception、action表現(joint target、end-effector delta、velocity)、control frequency、clipping規則、stopを観測するframeを記録する。意味的な指示を転移できても、action単位やlatencyが実機と違えば失敗する。

未実行の演習。 公開または合成の10 episodeからaction contract表を作る。simulatorまたは表計算でcamera delay、axis convention、action scaleの一つだけを変え、perception failureとcontract failureを分ける。hardwareへ命令は送らない。

2026-09の一次リリースは、2026-10-04時点でこの記事が扱うVLA群について確認できなかった。ここでの境界は日付付きの研究地図であり、最新のdeploy可能policyの主張ではない。

2026年9月のsignal:in-context task transferにもtest splitが要る

NVIDIAの9月10日のSkild AI S1発表は、robot foundation modelが一つのvideo demonstrationから未知のmulti-step taskを扱えるという提供者主張を説明する。これは独立benchmarkではなく、body間でobservation-to-actionのtimingが移植できることも示さない。発表は設計signalとして扱う。demonstrationをobject arrangement、camera pose、task sequenceで分け、新しいdemonstrationがretrainingなしでaction selectionを変えるか測る。completion、recovery、unsafe-stop rateを別々に記録する。

MENTAL MODEL / 座標

同じ点でも、座標は変わる。

ローカル座標の点 (1, 0) を、原点を共有する世界座標へ反時計回りに回転します。

x = cos θ
y = sin θ

これは2次元の回転だけの例。実機では並進、3次元、単位、時刻、軸の定義まで揃える必要があります。

xy(0.87, 0.50)

出典

01
RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control ↗arxiv.org · 2023-07-28
02
OpenVLA ↗arxiv.org · 2024-06-13
03
LeRobot ↗github.com · unknown
04
NVIDIA: Skild AI S1 physical AI announcement ↗blogs.nvidia.com · 2026-09-10

自分のノート