もっともらしい frame は event record ではない
2026-10-01 17:59:53 UTC(日本時間では10月2日)に、PROWBench の v1 は投稿された。source の日付だけの metadata は10月1日である。論文 header は ROWBench、abstract・project・repository は PROWBench と表記する。本稿は後者を使い、別 release があるとは推論しない。扱う問いは狭い。実行可能な program が記録した interaction を、生成動画が画面上で実際に描いたかである。gate が開き、人物が通過したと記録されていても、frame 列はもっともらしく見えながら、その event を欠落・遅延・変更し得る。
論文の設計は二つの artifact を分ける。実行可能な world record は entity state、camera state、timestamp 付き event を保存する。camera の外にある事実も含める。renderer は同じ record の同期した view を video model 用の入力へ変換する。record は「何が起きるべきだったか」の根拠であり、生成 clip は「何が可視に描かれたか」の証拠である。この二つを分けると、出力が良く見えるかだけを一つの score に委ねずに済む。
- 1実行可能な scene と event contract
- 2replayable state、camera path、event timeline
- 1同じ record
- 2proxy または reference clip
- 3generated video
- 1event window と期待する end state
- 2evaluator の判定:pass、reject、unknown
- 1visual plausibility の score
- 2別の review。event の根拠で置き換えない
著者らは同期 proxy view と event/timeline の検査を、geometric・perceptual な測定と併用して benchmark 結果を報告する。これは著者らの測定であり、この教材の独立結果、video service の保証、生成動画が物理的に正しい証拠ではない。
一つの score に畳み込んではいけない二問
論文は、event の必要 action/end state と、指定 action が time segment に現れるかを分ける。clip はおおむね正しい時間に action を描きながら、必要な end state を外し得る。また entity をもっともらしく配置しながら timeline を破り得る。
一つの shot には、次のような evaluation card を置ける。
| 問い | 残す evidence | 分離し続ける結果 |
|---|---|---|
| 意図した action は time window に現れたか | event ID、開始/終了 timestamp、期待 action、選んだ frame | visual quality |
| interaction は指定 end state に達したか | participant、end-state predicate、evidence frame | clip 内の他の prompt compliance |
| 出力は視覚的に使えるか | 明示した人手 review rubric | program の event が起きた証明 |
| evaluator は判定できるか | 理由と欠けた evidence | 強制した pass/fail の推測 |
unknown は正当な評価結果である。participant が隠れている、event が clip の外にある、reference timestamp を出力へ対応付けられない、reviewer が指定 end state を区別できない、といった場合に使う。曖昧な VLM の応答、高い similarity score、滑らかな motion curve を pass に変えない。人手 reviewer も誤るため、label だけでなく evidence frame と event rule を残す。
未実行の N=1 offline fixture
以下はこの教材のための小さな original fixture であり、ここでは実行していない。video-generation API、有料 model call、hardware control、個人映像の upload は不要である。synthetic storyboard か、許諾済みの internal animation を使い、event は一つだけにする。例は actor A reaches the blue gate; the gate opens; actor A is beyond the gate by 5.0 s である。
- 生成・review より前に event row を一つ書く。event ID、participant、time window、期待 action、end-state predicate、camera view、担当者である。
- 短い reference record を作る。
0.0–1.0 approach、1.0–2.0 gate opens、2.0–5.0 actor beyond gateのようにし、record と proxy drawing を local に保存する。 - 許可された local licence の clip が既にある場合だけ、各境界の周囲から固定 frame を選ぶ。この演習のために外部 service へ送らない。
- event row と照らして action と end state を review する。書いた rule の下で両方が見えるときだけ
pass、可視に rule を破るときはreject、それ以外はunknownとして不足した observation を書く。 - visual quality の note は別 column に置く。美しいが reject の clip は rendering failure の証拠であり、event に忠実だが見栄えの悪い clip は art direction の問題かもしれない。
record に timestamp mapping がない、source licence が review を許さない、participant identity を評価できない、end-state rule が曖昧、といった場合は fixture を stop する。prompt を修正せず、model を retry せず、agent を呼ばず、結果を実世界の主張に昇格させない。成果は leaderboard ではなく、監査可能な一行である。
次の実験を変える限界
論文の全39ページは、小さな fixture に重要な限界も記す。event/appearance の検査は human annotation に calibration されていない VLM judge に依存し、camera の測定は pose estimator の誤差を引き継ぐ。長い horizon の reappearance と、独立生成の複数 view 間の identity も未解決だと報告される。だから unknown を残し、高リスク映像には人手 review を使い、一行の event 判定を model 全体へ一般化しない。
2024年11月20日投稿の VBench++ v1 は、video quality と condition consistency の dimension を整理する先行資料である。対してこの fixture は、一つの executable event record に対する evidence を問う。二つは別の問いであり、どちらの score も他方を置き換えない。
論文の project と repository は実装を読む入口になるが、現在の page は provider account への access を与えず、他の media の production licence を確定せず、local の security・retention review を置き換えない。この fixture は reference-first production と接続する。reference は appearance と意図を指定し、event contract は clip が可視に証明すべき事実を指定する。shot を edit に回す前に、両方を残す。
MENTAL MODEL / カット設計
まず、ひとつのカットにひとつの役割。
合計 12 秒。各カットに参照画像、開始状態、ひとつの動作、終了状態を指定する。生成前に静止画をこの順で並べるだけでも、伝わらない接続が見つかります。
出典
公開日は資料の日付、確認日は内容を参照した日です。コミュニティの観測は公式の確定事項と区別します。
01