問いは「patchを消せるか」ではない

Vision-Language-Action(VLA)方策は、camera observationとtask instructionからrobot actionを出す。局所的な画像摂動は、撮像されたframeの変化がgrasp、移動、stopの判断を変え得るため、control pathの問題になる。設計で問うべきことは「堅牢か」という一語ではない。内部表現を変える前に何が変更の根拠になるか、clean taskでどの回帰を受け入れるか、その結果を実機につなぐ権限を誰が持つかを分ける。

2026年10月2日のarXiv v1論文 Detect and Suppress は、この問いをsimulationで調べる。studied patchをprobeが検知した後だけ内部featureを抑制する。これはcamera filterでも、一般的なsecurity productでも、実機のsafety caseでもない。

  1. 1保存済みcamera frameとtask instruction
  2. 2固定したVLA policy
  3. 3内部表現
  1. 1offline probe
  2. 2事前宣言したthresholdを超えるattack score
  3. 3条件付きfeature抑制
  1. 1未検知
  2. 2表現は不変
  3. 3simulatorだけでpolicy action
  1. 1二つのbranch
  2. 2attack成功率、clean task回帰、誤報、stop record
順序と役割を、ひとつずつ分けて考える

これは独自の概念図である。論文が評価したのは機構であり、下のreview gateとsimulator-onlyの手順はこの教材の設計である。

限定した系譜

OpenVLA は2024年6月に、visual observationとlanguageをaction generationへ結び付けるVLAの枠組みを具体化した。しかし、hostileなcamera inputに対するsecurityを示したものではない。PAD は2024年4月、object detector向けにadversarial patchを位置付けて除去する方法を扱った。object detectorはrobot policyではなく、visual preprocessorが下流actionの安全を示すわけでもない。

2026年の論文は、二つのVLA policyの内部へ問いを移す。画像pixelを消すのでなく、visual inputがpolicyへ入った後の内部表現を解析する。その代わり、attackの影響を減らす防御がcleanな挙動も変えてしまう。2024年の資料は歴史的な背景であり、その方法がこのVLA実験へ移る証拠ではない。

狭い著者結果

論文はLIBERO-10 simulationでpi_0.5とSmolVLAを、intermittentなUADA patchで評価する。SAE featureを選び、linear probeで抑制をgateし、主要な各条件で十task × 50 initial stateを評価する。thresholdは別のconstruction dataでfalse-positive rateが2%未満になるよう選ばれた。

残すべき結果はclean条件のtradeoffである。著者は条件付き介入でpi_0.5 successが54.4%から54.6%、SmolVLAは41.4%から36.6%になると報告する。常時抑制は両方でさらに悪い。これは著者のattack・simulator条件での測定であり、別のpatch、lighting変化、sticker、sensor fault、physical scene、別VLAの検知を示さない。

方法をreview gateへ変える

live VLAにhookを足すところから始めない。まずevidence pathを調べられるようにする。

  1. camera contractを固定する。 保存frameごとにepisode ID、timestamp、camera ID、calibration revision、decoder version、task instruction ID、policy/checkpoint IDを残す。一つのimage transformで訓練したprobeは、adversarial patchでなくcrop、compression artifact、遅延frameへ反応しているかもしれない。
  2. detectorとinterventionの判断を分ける。 attack score、threshold version、選択したfeature/layer ID、attenuation値、表現を変えたかを記録する。robot actionがおかしく見えたからといって、通常のperception failureをattackと呼び替えない。
  3. clean branchとattacked branchを同時に評価する。 同じinitial-state set、simulator version、action horizon、stop predicateを使う。success、false alarm、missed alarm、介入回数、固定baselineからの回帰を保存する。attack下のscoreが良くなってもclean回帰を消してはいけない。
  4. physical authorityは別に置く。 model-output gateにrobotを動かす権限はない。emergency stopの所有者、speed/force limit、exclusion zone、camera loss時の動作、reset、operator approvalは、別にreviewしたdeployment planの仕事である。

camera provenance、task contract、clean evaluationのどれかが欠けたらnot_evaluableと書いて止める。thresholdを下げたりhardwareで試したりして穴を埋めない。

未実行のoffline演習

この演習ではweightをdownloadせず、adversarial patchを作らず、APIを呼ばず、SAEを訓練せず、policyを変えず、robotをactuateしない。仮想のsimulator traceでreview packetを具体化するだけである。

同じ架空のepisode_id、task instruction、simulator resetを持つ二行を作る。一行目はattack_score=0.04で、宣言したthreshold 0.70より小さいためintervention=noneでなければならない。二行目はattack_score=0.83で、candidate_interventionとだけ書ける。表現を編集する許可ではない。frame_hash、camera_transform、policy_version、feature_id、threshold_version、baseline_outcome、guarded_outcome、stop_reason、reviewerを列にする。

失敗signal 調べる境界 安全な次の行動
clean traceのfalse alarm camera transform、thresholdのconstruction data、probe version traceを記録し、featureを黙って抑制しない
論文のattack fixtureでmissed alarm attack coverageまたはdetector representation missを残し、保護済みと呼ばない
attacked scoreは上がるがclean scoreが下がる intervention strengthまたはfeature selection このcontractでは設定をrejectする
frame provenanceやreset可能なsimulationがない data/evaluation contract not_evaluableでstopする

このpacketはalarmとsafety controllerを分ける。後のsimulation reviewには使えるが、camera trust、physical robustness、安全なgrasp、承認済みdeploymentを示すものではない。

費用、権限、論文が残す未確認点

論文は読者ごとのprice、runtime budget、deployment API、production access modelを示していない。local reproductionには、論文中のpolicy、SAE/probeのtraining・evaluation環境、LIBERO互換simulation、保存済みrollout、computeへのaccessが必要になる。ここでは何も実行していないため、cost、latency、必要resourceは測定していない。

sourceはrunnable code release、model-weight license、dataset license、他チームのpolicyを変更する権限、運用上のpatch-defense implementationのlicenseを確立しない。arXiv版が読めることは実行許可ではない。camera traceはsensitiveなoperational dataになり得る。承認されたevaluation workspaceだけに置き、人やprivate environmentを不必要に集めず、閲覧・保存の権限はdetectorでなく名前付きreviewerへ与える。

著者ら自身もunseen attackとphysical robotでの試験をfuture workにしている。この論文から得るべきmental modelは狭い。介入の前に検知し、clean regressionを測り、hardware gateを独立させる。 これは、実際のworkspaceでVLAがsecureだという証拠ではない。

MENTAL MODEL / 座標

同じ点でも、座標は変わる。

ローカル座標の点 (1, 0) を、原点を共有する世界座標へ反時計回りに回転します。

x = cos θ
y = sin θ

これは2次元の回転だけの例。実機では並進、3次元、単位、時刻、軸の定義まで揃える必要があります。

xy(0.87, 0.50)

出典

公開日は資料の日付、確認日は内容を参照した日です。コミュニティの観測は公式の確定事項と区別します。

01
公式ドキュメントDetect and Suppress: A Mechanistic Defense against Adversarial Patches in VLA Models, arXiv v1 ↗arxiv.org公開: 2026-10-02 · 確認: 2026-10-05
02
公式ドキュメントOpenVLA: An Open-Source Vision-Language-Action Model ↗arxiv.org公開: 2024-06-13 · 確認: 2026-10-05
03
公式ドキュメントPAD: Patch-Agnostic Defense against Adversarial Patch Attacks ↗arxiv.org公開: 2024-04-25 · 確認: 2026-10-05
このブラウザ内に保存します。