参照は飾りではなく、制約の束である

「短編を作りたい」とテキストだけで最初の動画を出すと、たいてい一発目は印象的になる。二本目で主人公の髪型が変わり、三本目で部屋の窓が反対側へ移る。原因はモデルが弱いからだけではない。制作者が世界の不変条件をまだ渡していないからだ。Reference-first は、文章から映像へ直行せず、先に繰り返し使える視覚上の事実を作る方法である。

Google のVeoページ は、場面・人物・物体・スタイルの参照画像、キャラクター一貫性、開始・終了フレーム、カメラ制御を機能として紹介する。これは個別サービスの機能表以上の示唆を持つ。生成器が受け取れる条件を増やしても、何を固定し何を変えるかを決めるのは人である。参照画像が一枚しかない時、裏側、歩いた時の服、表情変化まで同一性を保証すると考えてはいけない。

  1. 1一文の意図
  2. 2世界の不変条件
  3. 3reference pack
  1. 1reference pack
  2. 2キャラクター/小道具/場所シート
  3. 3ショットリスト
  1. 1各カットの開始条件
  2. 2生成候補
  3. 3選別
  4. 4編集タイムライン
順序と役割を、ひとつずつ分けて考える

企画を「変わらないもの」と「変えるもの」に割る

まず30秒なら、主人公、場所、時間帯、感情の変化を一文で決める。例は「雨上がりの夜、赤い傘の配達員が静かな喫茶店へ入り、湯気で曇った窓越しに安堵する」。次に固定表を作る。主人公は年齢や民族性を曖昧なラベルにせず、髪の長さ・色、上着、靴、持ち物、傷やアクセサリ、色の組み合わせに分解する。場所も「東京風」では足りない。カウンターの材、窓の位置、照明色、外の路面、画面内のロゴ禁止を明記する。

変える表には、カットごとの行動とカメラだけを置く。表情、手の位置、濡れ具合、傘の角度、焦点距離、画角、動き、尺である。こうすると、生成時に修正したい問題が固定要件か可変要件かを判断できる。服の色を直すためにカメラ説明まで書き換える必要がなくなる。

reference pack の作り方

一枚のヒーロー画像ではなく、少なくとも次を同じ命名規則で保存する。正面・斜め・横の人物、全身と胸上、顔の近景、衣服と小道具のクローズアップ、場所のワイド、場所の素材・照明、色見本である。正面図だけでは横顔を制御できない。場所の全景だけではカップの持ち手やテーブルの木目を保てない。画像は生成・撮影・3Dレンダーのどれでもよいが、利用権と写っている人の同意を確認する。

キャラクターシートには「許可する差」と「禁止する差」も書く。雨粒は増減してよい、瞳の色は固定、上着のボタン数は固定、右手首の時計は固定、といった具合だ。曖昧な美的指示を増やすより、連続カットで破綻した時に検査できる事実を増やす。参照を使えるモデルでも、参照と出力の距離が大きい動作ほど崩れやすい。振り返り、座る、物を持ち替える、複数人の接触は短い試験生成で先に確かめる。

ショットを独立した小問題にする

30秒を一つの長尺プロンプトにしない。8〜10カットに割り、各カットを「一つの意図、一つの主動作、一つのカメラ動作」に制限する。ショットカードには、ID、尺、起点参照、終点参照、画角、焦点距離の意図、被写体の位置、動作、音、合格条件を書く。たとえば V03 は4秒、窓外からのミディアム、50mm相当の圧縮感、主人公が傘を閉じる、傘は右から下へ、雨音だけ、時計と赤い傘を保つ、である。

  1. 1V01: 街の導入 3秒
  2. 2V02: 傘の足元 3秒
  3. 3V03: 入店 4秒
  1. 1V04: 湯気のカップ 3秒
  2. 2V05: 表情 4秒
  3. 3V06: 窓の反射 3秒
  1. 1各カット: 参照 + 固定条件 + 主動作 + カメラ + 合格条件
順序と役割を、ひとつずつ分けて考える

カット別に生成する利点は、失敗を局所化できることだ。V03の指が崩れてもV01を捨てなくてよい。欠点はつなぎである。光、人物の位置、視線、進行方向、音の残響を次カットへ渡すため、前カットの最後のフレームと編集上のカット点を「受け渡し資産」にする。開始・終了フレームを指定できる製品では特に有効だが、成功を約束するものではない。

生成、選別、編集、音声

各カードから低コストの候補を複数本作る。候補の良い部分を一つの動画内に求めず、カットごとに選ぶ。合格基準は、同一性、動作、カメラ、背景、物理、テキスト・ロゴ、つなぎの7項目を0〜2点にする。14点満点で例えば11未満なら再生成、人物同一性が0なら総点にかかわらず不合格と決めておく。これは実行済みの制作結果ではなく、再現可能な設計演習である。

編集ではまず無音で接続を確認する。次に環境音、効果音、台詞、音楽を別トラックで置く。ネイティブ音声生成は速いが、台詞の意味、口形、ノイズ、権利処理の評価を省けない。音が映像の切れを隠すこともあるため、音あり・なしの両方で確認する。最後に出力尺、字幕、来歴表示、公開先の規約を検査する。

失敗の記録が次の参照を強くする

「プロンプトを改善した」とだけ書いても再現できない。失敗カットに、入力参照の版、モデル・版、seed、設定、候補番号、観測した破綻、修正仮説、次に一つだけ変える条件を残す。人物が変わったなら、語句を足す前に横顔参照が足りないのか、動作が大き過ぎるのか、カットを分けるべきかを問う。reference-first の価値は、毎回正解を出すことではない。どの条件が画面を支配したかを、次のカットへ持ち越せることにある。

そのまま使えるショット・ブレークダウン

ショットカードは文章の上手さを競う欄ではない。後で比較できる変数を外へ出す欄である。ID / 尺 / 物語上の変化 / 開始フレーム資産 / 終了フレーム資産 / 主体の固定属性 / 可変の動作 / 画角・移動 / 光 / 音 / 次へ渡すもの / 不合格条件 を一カットごとに埋める。V05なら「4秒、緊張から安堵、カップ近景から窓の顔、赤い傘と右手首の時計を固定、カップを置き窓を見る、50mm相当の静止、青い窓光、雨音が弱まる、視線は右、時計消失や窓の移動は不合格」と書く。

この形式なら窓が変わった時に、人物の形容を足すのでなく、背景参照、画角、編集のどれを直すか選べる。キャラクター・バイブルも同じである。人物名ミナ、耳に掛かる黒髪、濡れた赤いレインコート、右手首の時計、半透明の傘を固定し、表情だけを無表情から小さな安堵まで可変にする。顔の厳密な類似より、色、位置、物という画面で検査できる事実を固定する。

  1. 1ショットID
  2. 2固定資産
  3. 3一つの主動作
  4. 4カメラ意図
  5. 5出口フレーム
  1. 1出口フレーム
  2. 2次ショットの入口参照
  3. 3編集上の接続を検査
  1. 1不合格条件
  2. 2原因仮説
  3. 3一条件だけ変えて再試行
順序と役割を、ひとつずつ分けて考える

この小さな仕様があれば、モデルや編集者が替わっても、同じ世界を次のショットへ引き継げる。

承認後の参照パックは変更履歴を持たせる。衣服色を変えた参照を同じ名前で上書きすると、どのカットが旧版を使ったか追跡できない。版名、日付、変更理由を残すだけで、連作の修正範囲を安全に特定できる。

2024年以降の provenance と reference の同意

画像、start/end frame、character control を受け付ける製品面が増えるにつれ、reference-first の重要性も増した。同時に信頼境界も変わる。reference は単なる見た目の入力ではなく、人物の likeness、著作物のデザイン、metadata、顧客文脈を含み得る。各 reference には、作成者または licence、許可された変形、公開先、削除日を残す。映像が安定していても、reference を公開できなければ使えない。

2026年8月19日のコミュニティ投稿にある複数カットと単一生成の話題は、制作者のワークフロー上の問いとしてのみ読む。各カットの前に、reference sheet と生成された直前フレームを比べ、人物同一性、衣装、空間形状、意図した変化を明示的に承認する review checkpoint を追加する。

現在の reference workflow も役割分担の問題である

Runway の9月24日 Fashion Workroom guide は、制作 flow を通じて reference を使う現在の vendor 例である。どの reference でも再利用できる許可や、cross-shot identity の証明にはならない。これを role sheet に変換する。subject identity、wardrobe/material、location/light、camera、禁止 mark 用の negative reference を分ける。各 asset の提供者、許可用途、失効日を記す。

9月23日 product-video guide も multi-shot の結果を計画済み sequence として扱う。各 shot の前に承認済み上流 reference version を固定する。各 shot の後には、pose、prop state、camera position のように意図した delta だけを書く。新 reference が必要なら、前の証拠を上書きせず新 version を作る。

MENTAL MODEL / カット設計

まず、ひとつのカットにひとつの役割。

01場所を伝える4秒
02動きを見せる4秒
03意味を残す4秒

合計 12 秒。各カットに参照画像、開始状態、ひとつの動作、終了状態を指定する。生成前に静止画をこの順で並べるだけでも、伝わらない接続が見つかります。

出典

01
Veo official model page ↗deepmind.google · unknown
02
Runway Gen-4 ↗runwayml.com · 2025-03-31
03
Runway Gen-4 announcement ↗runwayml.com · 2025-03-31
04
aivideo discussion (community experience) ↗www.reddit.com · 2026-08-19
05
Runway product-video workflow ↗dev.runwayml.com · 2026-09-23
06
Runway HDR video guide ↗dev.runwayml.com · 2026-09-23
07
Runway fashion workroom workflow ↗dev.runwayml.com · 2026-09-24
08
Runway model guide ↗docs.dev.runwayml.com · unknown
09
Runway deprecated standalone tools ↗help.runwayml.com · 2026-08-05

自分のノート