調査時点と読み方

これは 2026-10-04 に公開一次資料を確認した更新ノートである。「最新」から性能順位を作るのではなく、各資料が実際に何を主張し、何をまだ主張していないかを残す。論文のベンチマークは著者が定めたデータ、ロボット、成功条件の結果であり、別身体・別部屋・別安全条件への保証ではない。

SmolVLA:到達可能な実験系を開く

SmolVLA 論文と Hugging Face の発表は、450M の VLA、公開コミュニティ由来データ、LeRobot を通じた訓練・推論手順を提示する。発表は SmolVLM2 と flow-matching action expert、非同期推論を説明し、単一の消費者 GPU や小型機材を意識した入口を作った点が大きい。重要なのは「小さいからどこでも安全」ではなく、データ形式、方策、評価の鎖を自分で観察できることだ。公開された実験手順は再現性への入り口であって、手元のカメラ配置における成功率ではない。

π0 と π0.5:行動を flow として表す

π0は事前学習済み VLM の意味表現に flow matching による行動生成を重ね、単腕、双腕、移動マニピュレータを含むデータで一般的な方策を探る。連続行動を一回の離散トークン選択に固定せず、時間的に滑らかな軌道を生成しようとする点が核である。π0.5は異種ロボット、高レベル意味予測、ウェブ等の異なるデータを co-training し、open-world generalization を検討する。ここでの「open-world」は論文の研究主張であり、家庭で監督なしに動かせる製品認証ではない。観測外の障害物、壊れやすい対象、人との接触に対する安全保証を論文名から推論してはいけない。

OpenVLA と GR00T N1:公開性と身体の多様性

OpenVLAはオープンソース VLA として、重み、コード、データ条件を検討できる比較基盤を押し広げた。ライセンス、使ったデータ、チェックポイント、実行環境は各リリースで別途確認する。GR00T N1は人型ロボットを対象に、視覚言語モジュールと拡散 Transformer の行動モジュールを結ぶ dual-system を報告し、実機軌跡、人間動画、合成データの混合を扱う。人型は人間環境の道具へ届きやすい可能性がある反面、自由度、転倒、接触、遠隔監視の安全問題を増やす。

  1. 1OpenVLA
  2. 2公開基盤を比較・改変する入口
  1. 1π0 / π0.5
  2. 2VLM条件付き連続行動と異種データ
  1. 1SmolVLA + LeRobot
  2. 2小規模で訓練・評価の鎖を試す入口
  1. 1GR00T N1
  2. 2人型を含む身体横断の基盤モデル研究
  1. 1共通の未解決
  2. 2データ品質・分布外・遅延・安全・再現性
順序と役割を、ひとつずつ分けて考える

実務での比較質問

導入前には、(1) 対象身体と action space は一致するか、(2) カメラ・関節状態・周波数は何か、(3) 重み、コード、データ、ライセンスのどこが公開されているか、(4) 成功の定義と試行回数は何か、(5) 失敗時の停止と復帰は誰が保証するか、を同じ表にする。「パラメータ数」「デモ映像」「ベンチマーク一位」だけでは答えられない。

未確認事項も残る。本ノートは各モデルをこの環境で実行しておらず、特定ハードウェアとの互換性、推論遅延、ライセンスの適用、再現性能を検証していない。更新時には発表日を変更せず、新しいノートを追加して、元の主張と後続の結果を区別する。

2026年公開情報の確認限界

2026-10-04 に、各組織の公開ページ、arXiv、GitHub を調査した。本ノートで確認して引用できた発表日は、OpenVLA が 2024-06-13、π0 が 2024-10-31、GR00T N1 が 2025-03-18、π0.5 が 2025-04-22、SmolVLA が 2025-06-02(HF 発表は 2025-06-03)である。今回の確認では、これらと同じ比較軸を満たし、一次資料で裏付けられる 2026 年の新しい基盤 VLA 発表を追加できなかった。これは「2026年に発表が無い」という結論ではなく、この調査範囲で確認・記述できる資料が無かったという限界である。

次の更新では、モデル名検索だけでなく各公式研究ブログ、リポジトリの release、論文の revision、ライセンス変更を別々に確認する。更新ノートの評価欄には source_url, announcement_date, accessed_date, evidence_type, unverified を残す。例えば announcement は存在しても、重み公開、再現手順、商用可否、実機試験のいずれも自動的には裏付けない。

比較を実作業へ落とす実験表

小規模な導入評価なら、一モデルを選んで body, camera, state_dim, action_dim, action_horizon, control_hz, dataset_snapshot, success_definition, stop_definition を CSV に固定する。試行は最低でも開始姿勢を変えた複数 episode とし、成功だけでなく接触・停止・人の介入を一行ずつ記録する。モデル間の比較をするなら、同じ物体、同じカメラ、同じ停止ルール、同じ試行予算でなければ「どちらが良いか」は判定できない。実機を持たない段階では、この表に公開論文の明記済み情報だけを埋め、空欄を次の調査課題にする。

scoreの変化より先にembodimentの変化を比べる

共通benchmarkのscoreは、二つのpolicyが異なるbodyへ転移する証拠ではない。gripper geometry、action horizon、observation stack、teleoperation source、reset protocol、成功がtrial単位かsubtask単位か、人の介入後かを比べる。2026年7月のLingBot-VLA 2.0に関するcommunity discussionはin-distributionとout-of-distributionの差を報告した。これは独立検証ではなく発見の手掛かりだが、「generalist」を検査可能なsplitへ置き換える助けになる。

選定表ではheld-out embodimentまたはcamera placementを一つ確保し、task languageを固定し、trial数とmanual resetを伴って成功を報告する。隠れたoperator recovery後の成功は、自律完了とは別の列に置く。

現行発表はrankingではなく問いを変える

2026年9月10日のSkild AI S1発表はlong-horizon taskのin-context learningについて強い主張をする。2025年比較cardには、deployment時に何でconditionするか——language、image、video demonstration、retrieved memory、weights——と、その入力のどれをevaluationでheld-outにしたかの列を足す。video-conditionedの結果は、task informationとreset budgetを一致させるまでlanguage-onlyの結果と直接比べない。

MENTAL MODEL / 座標

同じ点でも、座標は変わる。

ローカル座標の点 (1, 0) を、原点を共有する世界座標へ反時計回りに回転します。

x = cos θ
y = sin θ

これは2次元の回転だけの例。実機では並進、3次元、単位、時刻、軸の定義まで揃える必要があります。

xy(0.87, 0.50)

出典

01
SmolVLA paper ↗arxiv.org · 2025-06-02
02
SmolVLA announcement ↗huggingface.co · 2025-06-03
03
pi0 ↗arxiv.org · 2024-10-31
04
pi0.5 ↗arxiv.org · 2025-04-22
05
GR00T N1 ↗arxiv.org · 2025-03-18
06
Reddit robotics discussion: LingBot-VLA 2.0 ↗www.reddit.com · unknown
07
NVIDIA: Skild AI S1 physical AI announcement ↗blogs.nvidia.com · 2026-09-10

自分のノート