もっともらしい frame は event record ではない

2026-10-01 17:59:53 UTC(日本時間では10月2日)に、PROWBench の v1 は投稿された。source の日付だけの metadata は10月1日である。論文 header は ROWBench、abstract・project・repository は PROWBench と表記する。本稿は後者を使い、別 release があるとは推論しない。扱う問いは狭い。実行可能な program が記録した interaction を、生成動画が画面上で実際に描いたかである。gate が開き、人物が通過したと記録されていても、frame 列はもっともらしく見えながら、その event を欠落・遅延・変更し得る。

論文の設計は二つの artifact を分ける。実行可能な world record は entity state、camera state、timestamp 付き event を保存する。camera の外にある事実も含める。renderer は同じ record の同期した view を video model 用の入力へ変換する。record は「何が起きるべきだったか」の根拠であり、生成 clip は「何が可視に描かれたか」の証拠である。この二つを分けると、出力が良く見えるかだけを一つの score に委ねずに済む。

  1. 1実行可能な scene と event contract
  2. 2replayable state、camera path、event timeline
  1. 1同じ record
  2. 2proxy または reference clip
  3. 3generated video
  1. 1event window と期待する end state
  2. 2evaluator の判定:pass、reject、unknown
  1. 1visual plausibility の score
  2. 2別の review。event の根拠で置き換えない
順序と役割を、ひとつずつ分けて考える

著者らは同期 proxy view と event/timeline の検査を、geometric・perceptual な測定と併用して benchmark 結果を報告する。これは著者らの測定であり、この教材の独立結果、video service の保証、生成動画が物理的に正しい証拠ではない。

一つの score に畳み込んではいけない二問

論文は、event の必要 action/end state と、指定 action が time segment に現れるかを分ける。clip はおおむね正しい時間に action を描きながら、必要な end state を外し得る。また entity をもっともらしく配置しながら timeline を破り得る。

一つの shot には、次のような evaluation card を置ける。

問い 残す evidence 分離し続ける結果
意図した action は time window に現れたか event ID、開始/終了 timestamp、期待 action、選んだ frame visual quality
interaction は指定 end state に達したか participant、end-state predicate、evidence frame clip 内の他の prompt compliance
出力は視覚的に使えるか 明示した人手 review rubric program の event が起きた証明
evaluator は判定できるか 理由と欠けた evidence 強制した pass/fail の推測

unknown は正当な評価結果である。participant が隠れている、event が clip の外にある、reference timestamp を出力へ対応付けられない、reviewer が指定 end state を区別できない、といった場合に使う。曖昧な VLM の応答、高い similarity score、滑らかな motion curve を pass に変えない。人手 reviewer も誤るため、label だけでなく evidence frame と event rule を残す。

未実行の N=1 offline fixture

以下はこの教材のための小さな original fixture であり、ここでは実行していない。video-generation API、有料 model call、hardware control、個人映像の upload は不要である。synthetic storyboard か、許諾済みの internal animation を使い、event は一つだけにする。例は actor A reaches the blue gate; the gate opens; actor A is beyond the gate by 5.0 s である。

  1. 生成・review より前に event row を一つ書く。event ID、participant、time window、期待 action、end-state predicate、camera view、担当者である。
  2. 短い reference record を作る。0.0–1.0 approach、1.0–2.0 gate opens、2.0–5.0 actor beyond gate のようにし、record と proxy drawing を local に保存する。
  3. 許可された local licence の clip が既にある場合だけ、各境界の周囲から固定 frame を選ぶ。この演習のために外部 service へ送らない。
  4. event row と照らして action と end state を review する。書いた rule の下で両方が見えるときだけ pass、可視に rule を破るときは reject、それ以外は unknown として不足した observation を書く。
  5. visual quality の note は別 column に置く。美しいが reject の clip は rendering failure の証拠であり、event に忠実だが見栄えの悪い clip は art direction の問題かもしれない。

record に timestamp mapping がない、source licence が review を許さない、participant identity を評価できない、end-state rule が曖昧、といった場合は fixture を stop する。prompt を修正せず、model を retry せず、agent を呼ばず、結果を実世界の主張に昇格させない。成果は leaderboard ではなく、監査可能な一行である。

次の実験を変える限界

論文の全39ページは、小さな fixture に重要な限界も記す。event/appearance の検査は human annotation に calibration されていない VLM judge に依存し、camera の測定は pose estimator の誤差を引き継ぐ。長い horizon の reappearance と、独立生成の複数 view 間の identity も未解決だと報告される。だから unknown を残し、高リスク映像には人手 review を使い、一行の event 判定を model 全体へ一般化しない。

2024年11月20日投稿の VBench++ v1 は、video quality と condition consistency の dimension を整理する先行資料である。対してこの fixture は、一つの executable event record に対する evidence を問う。二つは別の問いであり、どちらの score も他方を置き換えない。

論文の project と repository は実装を読む入口になるが、現在の page は provider account への access を与えず、他の media の production licence を確定せず、local の security・retention review を置き換えない。この fixture は reference-first production と接続する。reference は appearance と意図を指定し、event contract は clip が可視に証明すべき事実を指定する。shot を edit に回す前に、両方を残す。

MENTAL MODEL / カット設計

まず、ひとつのカットにひとつの役割。

01場所を伝える4秒
02動きを見せる4秒
03意味を残す4秒

合計 12 秒。各カットに参照画像、開始状態、ひとつの動作、終了状態を指定する。生成前に静止画をこの順で並べるだけでも、伝わらない接続が見つかります。

出典

公開日は資料の日付、確認日は内容を参照した日です。コミュニティの観測は公式の確定事項と区別します。

01
PROWBench: Do Video Models Render What the Program Specifies? ↗arxiv.org公開: 2026-10-01 · 確認: 2026-10-04
02
PROWBench project公開: 不明 · 確認: 2026-10-04
03
PROWBench source repository公開: 不明 · 確認: 2026-10-04
04
VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models ↗arxiv.org公開: 2024-11-20 · 確認: 2026-10-04
このブラウザ内に保存します。