動画は「画像に動きを足す」より難しい

一枚絵が美しければ、次の一枚も美しいはずだ、と考えたくなる。しかし二枚の間に人物の手、服のしわ、光源、カメラの位置がある。動画生成の失敗が目立つのは、各フレームが悪いからではない。フレーム間の因果が崩れるからである。コップを置いた手が次の瞬間に指を増やす、背後の窓がパンに合わせて別の窓へ変わる。視聴者は静止画なら見逃す差分を、時間の連続性として即座に検出する。

初期の画像生成はGAN、自己回帰、拡散という競争を経た。現在の大規模動画モデルを理解する足場は、潜在拡散である。まずエンコーダが高解像度の動画を圧縮した潜在空間へ写す。次にモデルは、ノイズになった「時間を含む潜在ブロック」から、条件文や参照画像に合う映像へ少しずつ戻す。OpenAIのSora system card は、動画を低次元の潜在表現に圧縮し、それを時空間パッチへ分割すると説明する。ここで重要なのは、パッチが画面だけでなく時間もまたぐことだ。遠くへ消えた人物が戻る場面でも、モデルは同じ人物らしさを保つ手掛かりを持てる。

  1. 1テキスト・参照・カメラ意図
  2. 2条件表現
  1. 1動画
  2. 2VAEで潜在圧縮
  3. 3時空間パッチ
  4. 4DiT/Transformer
  1. 1ノイズ潜在
  2. 2反復的な復元またはベクトル場の追跡
  3. 3潜在動画
  4. 4デコード
順序と役割を、ひとつずつ分けて考える

Diffusion、Flow、DiTは競合する三つの名前ではない

Diffusion は、データへ少しずつノイズを加えた逆操作を学ぶ考え方である。生成時には乱数から開始し、何十回かの更新で映像に近づける。扱いが安定し、条件付けや編集に接続しやすかったため、画像から動画への最初の大きな足場になった。一方で、反復回数は速度と費用を押し上げる。長い動画は時空間トークン数が増え、注意機構の計算量も重くなる。

Flow Matching は「今いる点から、データ分布へ向かう速度ベクトル」を直接回帰する枠組みである。原論文 は、シミュレーション不要の学習で連続正規化フローを大規模化でき、拡散経路もその特殊例として含められると述べる。制作側がこれを知る理由は、宣伝上の新語を追うためではない。サンプラーの歩数、蒸留、リアルタイム性が「粗いラフを何本試せるか」を変えるからである。短い反復で速いモデルは探索向きだが、速さが長尺の因果や細部の完全性を保証するわけではない。

DiT は Diffusion Transformer の略で、ノイズ除去器を畳み込み中心のネットワークから Transformer 中心へ置き換える設計である。画像・音声・動画をパッチ列として同じように扱えるため、スケールしやすく、テキスト条件との結合も自然になる。Sora の「可変の長さ・解像度・アスペクト比の視覚データをパッチにする」という発想は、素材を一つの固定フレームサイズに縛らない。だがパッチ化は物理法則を埋め込む魔法ではない。もっともらしい重力、液体、接触は学習分布の予測であり、機械シミュレーションの結果ではない。

何が変わり、何が残ったか

動画モデルの強みは、絵コンテ、商品イメージ、世界観検証を撮影前に動かせることだ。LTX-Video の公式リポジトリは小型蒸留版を素早い反復向け、より大きい版を品質寄りとして分け、Pose・Depth・Canny の制御モデルも提示する。LTX-Video の Apache-2.0 はコードのライセンスであり、重みや周辺素材の条件まで同じだと推測してはいけない。各重み配布先の利用条件を別に読む必要がある。

同じ理由で「オープン」はローカル実行を約束しない。モデル重みの公開、推論コードの公開、商用利用、学習利用、人物肖像の扱いは別の軸である。クラウド提供モデルも、APIで利用できることと、学習データや内部評価が全面公開されることは別だ。モデル提供者のベンチマークは候補選定の材料にはなるが、撮りたい被写体・画角・音声・編集工程を含む独立評価にはならない。

手を動かすための最小実験

まだモデルを実行していない読者は、比較可能な演習から始める。5秒、24fps、16:9の「窓際で湯気の立つカップを左から右へゆっくりパンする」だけを固定する。プロンプトには主体、場所、光、カメラ、動作、禁止したい変化を一文ずつ分ける。seed、参照画像、解像度、steps、CFG、生成日時、モデル版を表に記録する。次に一回だけ、カメラを固定から横移動へ替える。良くなったかを「好み」で終えず、人物同一性、接触、背景安定、指、カメラ意図、音の同期を各0〜2点で採点する。

  1. 1同一の参照とseed
  2. 2固定カメラの5秒
  3. 3採点
  1. 1条件を一つだけ変更
  2. 2横移動の5秒
  3. 3差分を記録
  1. 1低得点の原因
  2. 2プロンプトか参照か制御か編集で切り分け
順序と役割を、ひとつずつ分けて考える

この実験で得るのは「最高の動画」ではない。どのモデルも失敗する条件、そして自分の工程で許容できる失敗の種類である。生成器を撮影機材の代替とみなすと、失敗は偶然に見える。確率的な候補生成器として扱い、カット、選別、補正、編集を分業すると、技術の変化が制作の速度に変わる。

評価の注意

Sora の公開資料は動画を拡散モデルとして説明し、C2PA を含む来歴と安全対策にも触れている。しかし公開時点の提供形態・上限・利用可能な入力は製品改定で変わり得る。本文は2026-10-04に取得した資料に基づく概念解説であり、特定モデルの利用可否や費用の断定ではない。人の肖像、既存作品、ニュースらしい映像を扱う前には、各サービスのポリシー、本人の同意、表示・来歴要件を確認する。

生成器の内部と制作判断を接続する

時空間パッチは広い時間範囲の関係を扱いやすくするが、脚本上の重要度や商品名の正確さまで決めない。制作側は長い動作を短い意図へ切り、各意図の入口と出口を明示する。生成設定は、尺と比率、参照と構図、動作、スタイル、最後に解像度の順で決める。低解像度のラフで「誰が、どこで、何を、どちらへ動くか」を通し、合格カットだけで表面品質を上げる。

  1. 1低コストの構図試験
  2. 2同一性と動作の試験
  3. 3接続の試験
  1. 1合格カット
  2. 2高解像度と補正
  3. 3編集タイムライン
  1. 1編集で見つけた破綻
  2. 2入力条件へ戻す
  3. 3次の設計を更新
順序と役割を、ひとつずつ分けて考える

評価では一番よい候補だけでなく、合格候補率を残す。10回のうち何回が同一性、接触、カメラ、背景条件を満たすかを数える。一本の傑作があっても採用率が低ければ納期と費用は読めない。派手さが少なくても一定条件で合格率が高いモデルは連作で強い。比較は一回勝負の美的評価でなく、工程の確率を比べる作業になる。

この記録は将来のモデル更新時にも同じ入力セットで再評価できる。変わったのがモデルなのか、制作条件なのかを分けるための基準線になる。

2024〜2026の境界:アーキテクチャの主張と製品提供を分ける

2024年の Sora 研究公開は、patch 化した動画・画像表現と diffusion transformer を制作計画のための有用な見取り図にした。しかしアーキテクチャが連続していても、製品契約が継続するとは限らない。OpenAI の Sora ページは、製品が 2026-04-26 に利用不能になったと記す。モデル論文、system card、実際に使える製品面を三つの別の観測として扱う。新しいワークフローでは各々の確認日を残し、特定サービス名に依存せず書き出せる中間形式を計画する。

2026年8月19日のコミュニティ投稿での「一つの長い生成」か「カットをつなぐか」という議論は、利用者が今もカット境界をワークフロー上の問題として診断していることを示す。ただしモデル能力の根拠ではない。自分で一動作を単一クリップと二カットで作り、人物同一性、物体位置、編集可能性をフレーム単位で比べる。

2026年9月の制作文脈:アーキテクチャは納品契約ではない

Runway の9月23日 product-video guide は multi-shot planning と model-selection table を含む現在の workflow surface を示す。これは公式の vendor workflow guide であり、列挙された model が同じ architecture、provider terms、測定済み品質を持つ証拠ではない。architecture map に delivery layer を足す。境界のある shot task を選び、source/reference、生成中間物、edit 判断、export codec、review 結果を記録する。「world model」の主張と、workflow が編集を越えて identity と artifact を保てるかは別である。

演習では同じ reference sheet から4秒の clip を二つ作る。一つは固定 camera、もう一つは予定した cut にする。render 前に不変であるべき変数を書く。export 後は境界 frame、audio start、color transform、provenance metadata を検査する。失敗記録は latent-model の説明と並べる。

MENTAL MODEL / カット設計

まず、ひとつのカットにひとつの役割。

01場所を伝える4秒
02動きを見せる4秒
03意味を残す4秒

合計 12 秒。各カットに参照画像、開始状態、ひとつの動作、終了状態を指定する。生成前に静止画をこの順で並べるだけでも、伝わらない接続が見つかります。

出典

01
Sora System Card ↗openai.com · 2024-12-09
02
Flow Matching for Generative Modeling ↗arxiv.org · 2022-10-06
03
LTX-Video official repository ↗github.com · unknown
04
OpenAI Sora product page ↗openai.com · 2024-02-15
05
aivideo discussion (community experience) ↗www.reddit.com · 2026-08-19
06
Runway product-video workflow ↗dev.runwayml.com · 2026-09-23
07
Runway HDR video guide ↗dev.runwayml.com · 2026-09-23
08
Runway fashion workroom workflow ↗dev.runwayml.com · 2026-09-24
09
Runway model guide ↗docs.dev.runwayml.com · unknown
10
Runway deprecated standalone tools ↗help.runwayml.com · 2026-08-05

自分のノート