読む順番を変える

VLA 論文を読むと、魅力的なデモと平均成功率に先に目を奪われる。しかし実装判断に必要なのは、モデル名ではなく契約である。入力は何か、出力 action はどの座標系と周波数か、どの身体で、どんなデータを使い、何を成功と呼び、何を測っていないか。この順番で読むと、異なる論文が同じ「VLA」の語を使っていても、置換可能ではない理由が見える。

  1. 1論文の主張
  2. 2入力・action・身体を抽出
  3. 3データ来歴を抽出
  1. 1評価条件
  2. 2成功と失敗の定義
  3. 3自分の条件との差分
  1. 1差分
  2. 2再現課題/追加収集/導入しない判断
順序と役割を、ひとつずつ分けて考える

π0を読む

π0は、事前学習 VLM の表現と flow matching による action 生成を結ぶ。単腕、双腕、移動マニピュレータを含むデータで、ゼロショット、言語条件、fine-tuning を評価する研究である。ここでの設計上の問いは「なぜ action を flow で表すか」だ。多峰的で連続的な軌道を扱う可能性があり、滑らかな動きを出しやすい一方、推論計算、行動チャンク、観測遅延、低レベル安全制約の統合が必要になる。論文の家事デモを見て、別アームの関節定義やカメラ配置にも同じ方策を直接適用できると考えてはいけない。

SmolVLAを読む

SmolVLAは 450M 級の小型 VLA と、公開コミュニティデータに基づく再現可能な実験経路を強調する。公表資料は SmolVLM2、複数 RGB、状態、言語指示、action expert、非同期推論を説明する。大きな意味は「基盤モデルの研究を高価な閉鎖系だけに置かない」ことにある。小型化は遅延・費用・反復を下げる可能性があるが、データが少ないから自動的に頑健になるわけではない。公開ベンチマークと自分の机、光、物体、遅延は別の分布である。

GR00T N1を読む

GR00T N1は人型ロボット向けに、視覚言語の System 2 と diffusion transformer の System 1 を組み合わせ、実機軌跡、人間動画、合成データを混合する。人間動画をデータ源に含められる発想は、ロボット行動データが希少という問題への応答だが、映像から直接取れない接触力、関節角、把持の成否、身体差をどう埋めるかが残る。人型であることは人間環境への適合の可能性を広げると同時に、転倒・接触・多自由度の検証面積を広げる。

比較の物差し

三者を同じ順位表にしない。π0 は flow action と異種ロボットデータ、SmolVLA は小型・公開実験鎖、GR00T は人型と異種データ混合にそれぞれ焦点がある。比較表には、body、観測、action representation、data provenance、weights/code/license、訓練環境、テスト分布、試行数、失敗判定、実機監視を埋める。空欄は低評価ではなく「まだ知らない」である。

演習:一枚の導入判定書

三論文のいずれか一つについて、あなたの仮想タスク「棚から柔らかい袋を取り出す」へ適用する判定書を書く。列は 論文で観測済み、自分の環境との差、安全上の追加条件、最小の非実機検証、採用を止める条件 にする。最後の列に「比較に必要なデータが無い」「action 定義が一致しない」「停止条件を実装できない」を含める。研究理解は採用へ急ぐためだけでなく、採用しない理由を根拠付きで作るための道具でもある。

論文から実験仕様を抽出するテンプレート

読んだ直後に、observation={camera names,resolution,history,state}、action={space,unit,horizon,frequency}、dataset={source,episodes,robots,license}、training={pretrain,finetune,compute}、evaluation={tasks,trials,success,intervention} を埋める。数値が本文に無ければ推測せず not reported と書く。次に自分の設計との差を、入力、出力、身体、分布、安全の五列にする。例えば論文の action が正規化済み 7 次元だとして、手元の 6 軸 arm の tool-frame 速度へ直接対応するとは限らない。adapter を書く前に、単位、順番、範囲、逆変換を検査する。

比較実験の最小単位

方策 A/B を比較するなら、同じ episode seed、開始姿勢、物体、カメラ、最大時間、停止規則で対にする。結果テーブルは trial_id, policy_version, seed, object_id, start_pose_id, completed, time_s, intervention, stop_reason, video_id とする。成功率の差だけでなく、止まった理由と介入頻度を読む。試行を途中で除外する基準は先に決め、失敗動画を削除しない。データ不足なら「差がある」と結論せず、区間または試行数不足を記録する。

train/eval 漏洩の読解チェック

論文やリポジトリを読む際、同じ物体・同じシーン・同じ遠隔操作セッションが train と eval に跨いでいないか、未知性は何で定義したかを確認する。言語だけを言い換えた split は視覚一般化を測らず、背景だけを変えた split は操作一般化を測らない。ウェブや人間動画を使う研究では、下流評価に近いデータが事前学習に含まれる可能性も、資料に書かれた範囲で確認する。書かれていなければ漏洩と断定せず、比較限界として保留する。

実機なしの検証では、公開された task 定義を使い、合成 episode を group split して、意図的に同じ video hash を train/test へ混入させる。分割検査が失敗を報告すれば、少なくとも評価パイプラインが見える重複を防げる。VLA の能力を再現したことにはならないが、論文の評価契約を自分の作業へ翻訳できたかを確かめられる。

読解の最終成果は「再現した」という宣言ではなく、追試の作業票である。環境、データ取得元、ライセンス確認、必要な sensor、action adapter、評価指標、停止規則、公開できない情報を分けて書く。いずれかが欠ければ、再現作業を開始せず、その欠落を調査課題に戻す。研究の数字を自分の数字として転載しないことも、Physical AI を実務へつなぐ基本的な品質管理になる。

レビュー会では、論文を読んでいない人へ作業票だけを渡す。「何をダウンロードするか」「何をまだダウンロードしてはいけないか」「一試行を何で成功と判断するか」「停止時に何を保存するか」を答えられなければ、作業票を直す。モデルの新規性の説明と、実験を安全に運用する説明は別の文章として持つ必要がある。

すべてのpaper cardにembodiment行を足す

各paperに平均化できない一行を足す。body、end effector、camera placement、action parameterization、reset procedure、evaluator interventionである。この行がないscore比較は、別のcontrol問題を隠したままsemantic competenceを比べる。最初のunsafe trajectoryで失敗と数えるのか、reset後か、人がsceneを戻した後だけなのかを問う。

readingの出力は反証可能なtransfer hypothesisにする。「このcamera delayとaction scalingなら、policyはN trialでobject orientationを保つ」の形である。paperが必要な変数を公開していなければ、demo videoから推測せずtransfer claimを未検証と印す。

deployment announcementはevidence tableではなくinterfaceとして読む

2026年9月22日のNVIDIA Isaac ROS 5.0発表はpolicyとROS deploymentの間のintegration layerを特定するには有用である。π0、SmolVLA、GR00Tと同じperformance tableへ置いてはならない。reading cardに別の「integration evidence」欄を足す。runtime、message schema、hardware support、version pin、主張されたpolicy evaluationが実際にそのpathを使ったかである。

2024年のモデルの主張と、platformの主張を分ける

2024年6月13日のOpenVLA preprintを、日付付きのモデル層の基準にする。上記の2026年9月のIsaac ROS発表は、システムの別の層を扱う。platform統合だけではpolicyの結果を再現しない。checkpoint、訓練data、action表現を一方に、middleware版、timestamp、deployment interfaceをもう一方に置いた二列の証拠表を作る。改善の主張ごとに、どちらの列が変わり、何を測ったか特定する。組み合わせたstackを測定していない資料なら、二つの発表を一つの結果へ足し合わせず、その比較を未確認とする。

MENTAL MODEL / 座標

同じ点でも、座標は変わる。

ローカル座標の点 (1, 0) を、原点を共有する世界座標へ反時計回りに回転します。

x = cos θ
y = sin θ

これは2次元の回転だけの例。実機では並進、3次元、単位、時刻、軸の定義まで揃える必要があります。

xy(0.87, 0.50)

出典

01
pi0 ↗arxiv.org · 2024-10-31
02
SmolVLA ↗arxiv.org · 2025-06-02
03
GR00T N1 ↗arxiv.org · 2025-03-18
04
NVIDIA Isaac ROS 5.0 announcement ↗blogs.nvidia.com · 2026-09-22
05
OpenVLA historical preprint ↗arxiv.org · 2024-06-13

自分のノート