問いは「patchを消せるか」ではない
Vision-Language-Action(VLA)方策は、camera observationとtask instructionからrobot actionを出す。局所的な画像摂動は、撮像されたframeの変化がgrasp、移動、stopの判断を変え得るため、control pathの問題になる。設計で問うべきことは「堅牢か」という一語ではない。内部表現を変える前に何が変更の根拠になるか、clean taskでどの回帰を受け入れるか、その結果を実機につなぐ権限を誰が持つかを分ける。
2026年10月2日のarXiv v1論文 Detect and Suppress は、この問いをsimulationで調べる。studied patchをprobeが検知した後だけ内部featureを抑制する。これはcamera filterでも、一般的なsecurity productでも、実機のsafety caseでもない。
- 1保存済みcamera frameとtask instruction
- 2固定したVLA policy
- 3内部表現
- 1offline probe
- 2事前宣言したthresholdを超えるattack score
- 3条件付きfeature抑制
- 1未検知
- 2表現は不変
- 3simulatorだけでpolicy action
- 1二つのbranch
- 2attack成功率、clean task回帰、誤報、stop record
これは独自の概念図である。論文が評価したのは機構であり、下のreview gateとsimulator-onlyの手順はこの教材の設計である。
限定した系譜
OpenVLA は2024年6月に、visual observationとlanguageをaction generationへ結び付けるVLAの枠組みを具体化した。しかし、hostileなcamera inputに対するsecurityを示したものではない。PAD は2024年4月、object detector向けにadversarial patchを位置付けて除去する方法を扱った。object detectorはrobot policyではなく、visual preprocessorが下流actionの安全を示すわけでもない。
2026年の論文は、二つのVLA policyの内部へ問いを移す。画像pixelを消すのでなく、visual inputがpolicyへ入った後の内部表現を解析する。その代わり、attackの影響を減らす防御がcleanな挙動も変えてしまう。2024年の資料は歴史的な背景であり、その方法がこのVLA実験へ移る証拠ではない。
狭い著者結果
論文はLIBERO-10 simulationでpi_0.5とSmolVLAを、intermittentなUADA patchで評価する。SAE featureを選び、linear probeで抑制をgateし、主要な各条件で十task × 50 initial stateを評価する。thresholdは別のconstruction dataでfalse-positive rateが2%未満になるよう選ばれた。
残すべき結果はclean条件のtradeoffである。著者は条件付き介入でpi_0.5 successが54.4%から54.6%、SmolVLAは41.4%から36.6%になると報告する。常時抑制は両方でさらに悪い。これは著者のattack・simulator条件での測定であり、別のpatch、lighting変化、sticker、sensor fault、physical scene、別VLAの検知を示さない。
方法をreview gateへ変える
live VLAにhookを足すところから始めない。まずevidence pathを調べられるようにする。
- camera contractを固定する。 保存frameごとにepisode ID、timestamp、camera ID、calibration revision、decoder version、task instruction ID、policy/checkpoint IDを残す。一つのimage transformで訓練したprobeは、adversarial patchでなくcrop、compression artifact、遅延frameへ反応しているかもしれない。
- detectorとinterventionの判断を分ける。 attack score、threshold version、選択したfeature/layer ID、attenuation値、表現を変えたかを記録する。robot actionがおかしく見えたからといって、通常のperception failureをattackと呼び替えない。
- clean branchとattacked branchを同時に評価する。 同じinitial-state set、simulator version、action horizon、stop predicateを使う。success、false alarm、missed alarm、介入回数、固定baselineからの回帰を保存する。attack下のscoreが良くなってもclean回帰を消してはいけない。
- physical authorityは別に置く。 model-output gateにrobotを動かす権限はない。emergency stopの所有者、speed/force limit、exclusion zone、camera loss時の動作、reset、operator approvalは、別にreviewしたdeployment planの仕事である。
camera provenance、task contract、clean evaluationのどれかが欠けたらnot_evaluableと書いて止める。thresholdを下げたりhardwareで試したりして穴を埋めない。
未実行のoffline演習
この演習ではweightをdownloadせず、adversarial patchを作らず、APIを呼ばず、SAEを訓練せず、policyを変えず、robotをactuateしない。仮想のsimulator traceでreview packetを具体化するだけである。
同じ架空のepisode_id、task instruction、simulator resetを持つ二行を作る。一行目はattack_score=0.04で、宣言したthreshold 0.70より小さいためintervention=noneでなければならない。二行目はattack_score=0.83で、candidate_interventionとだけ書ける。表現を編集する許可ではない。frame_hash、camera_transform、policy_version、feature_id、threshold_version、baseline_outcome、guarded_outcome、stop_reason、reviewerを列にする。
| 失敗signal | 調べる境界 | 安全な次の行動 |
|---|---|---|
| clean traceのfalse alarm | camera transform、thresholdのconstruction data、probe version | traceを記録し、featureを黙って抑制しない |
| 論文のattack fixtureでmissed alarm | attack coverageまたはdetector representation | missを残し、保護済みと呼ばない |
| attacked scoreは上がるがclean scoreが下がる | intervention strengthまたはfeature selection | このcontractでは設定をrejectする |
| frame provenanceやreset可能なsimulationがない | data/evaluation contract | not_evaluableでstopする |
このpacketはalarmとsafety controllerを分ける。後のsimulation reviewには使えるが、camera trust、physical robustness、安全なgrasp、承認済みdeploymentを示すものではない。
費用、権限、論文が残す未確認点
論文は読者ごとのprice、runtime budget、deployment API、production access modelを示していない。local reproductionには、論文中のpolicy、SAE/probeのtraining・evaluation環境、LIBERO互換simulation、保存済みrollout、computeへのaccessが必要になる。ここでは何も実行していないため、cost、latency、必要resourceは測定していない。
sourceはrunnable code release、model-weight license、dataset license、他チームのpolicyを変更する権限、運用上のpatch-defense implementationのlicenseを確立しない。arXiv版が読めることは実行許可ではない。camera traceはsensitiveなoperational dataになり得る。承認されたevaluation workspaceだけに置き、人やprivate environmentを不必要に集めず、閲覧・保存の権限はdetectorでなく名前付きreviewerへ与える。
著者ら自身もunseen attackとphysical robotでの試験をfuture workにしている。この論文から得るべきmental modelは狭い。介入の前に検知し、clean regressionを測り、hardware gateを独立させる。 これは、実際のworkspaceでVLAがsecureだという証拠ではない。
MENTAL MODEL / 座標
同じ点でも、座標は変わる。
ローカル座標の点 (1, 0) を、原点を共有する世界座標へ反時計回りに回転します。
x = cos θ
y = sin θ
これは2次元の回転だけの例。実機では並進、3次元、単位、時刻、軸の定義まで揃える必要があります。
出典
公開日は資料の日付、確認日は内容を参照した日です。コミュニティの観測は公式の確定事項と区別します。
01