生成画像は「文章を描く機械」ではない
プロンプトに書いた名詞が絵の中にあると、モデルは文章を理解して描いたように見える。しかし実際の生成器は、条件に合いそうな画像分布を探索する確率モデルである。だから「赤い椅子、青い壁」は比較的安定しても、「右手で青いカップの持ち手をこちらへ向ける」は関係と視点を同時に満たす必要があり、崩れやすい。言葉を増やせば支配力が増すわけではない。
拡散モデルは、訓練時に画像へノイズを段階的に加え、そのノイズを取り除く方向を学ぶ。生成時にはランダムなノイズから出発し、条件文・参照画像・マスクに従って少しずつ画像へ近づく。高解像度のピクセルを直接処理すると重いため、多くの実装は VAE などで圧縮した潜在空間に入り、最後にデコードする。潜在の小さな差が、デコード後には髪型、光、背景の大きな差として現れることがある。
- 1テキスト/参照/マスク
- 2条件表現
- 1画像
- 2潜在圧縮
- 3ノイズ付加
- 1乱数潜在 + 条件
- 2反復するノイズ除去または速度場追跡
- 3潜在画像
- 4デコード
Flow Matching と DiT が変えた問い
Flow Matching は、ノイズからデータへ向かう経路の「速度ベクトル」を学ぶ連続正規化フローの学習法である。原論文 は、既存の拡散経路を含む確率経路に対応し、最適輸送に由来する経路では速い学習・サンプリングの可能性を示した。制作者が覚えるべきなのは数式ではなく、生成の歩数や蒸留が、探索できる候補数と品質のトレードオフになることだ。少ないステップで速く作れるモデルはラフの比較に強い。細部、文字、手、参照保存の品質を自動的に同じ水準にするものではない。
DiT(Diffusion Transformer)はノイズ予測器を Transformer にした設計である。画像をパッチ列として処理でき、テキスト条件との注意機構を大規模に伸ばしやすい。モデル名に「Transformer」があっても、出力が事実を検索した証拠にはならない。生成器はウェブページを参照して正確なロゴや表を描いているのではなく、学習した視覚的規則から推定している。重要な文字、表、法的表記は生成結果だけに任せず、編集ソフトで後から載せる方が検証可能である。
条件付けを分けて考える
テキストは意味と雰囲気を渡す。参照画像は形、色、被写体を渡す。マスクは変える場所と残す場所を渡す。Depth、Pose、Canny などの制御画像は幾何、人体姿勢、輪郭を渡す。これらを一つの「プロンプト力」とみなすと、失敗した時に原因が分からなくなる。人物の服を保ちたいなら参照、背景だけを替えたいならマスク、同じ構図を保ちたいなら制御画像、情景の意味を変えたいならテキスト、というように責務を分ける。
- 1意味: テキスト
- 2被写体・行為・雰囲気
- 1同一性: 参照
- 2顔・服・製品・色
- 1局所性: マスク
- 2変える領域/残す領域
- 1構図: Pose/Depth/Edge
- 2骨格・奥行き・輪郭
速い実験の設計
同じ被写体、同じアスペクト比、同じ参照を使い、まず生成サイズを抑える。候補を四つ作り、構図、同一性、文字、手、余白、用途適合を0〜2点で採点する。次に変更するのは一条件だけにする。プロンプトの背景を変える、参照を横顔に替える、マスクを狭める、といった操作である。seed を固定できる環境では固定し、変化の原因を観察する。固定できない製品では、入力と出力ID、日時、モデル名、設定を残す。
Stable Diffusion 3.5 の公式発表 は Large、Turbo、Medium を案内し、Community License を掲げる。だが「consumer hardwareで動く」という提供者の説明は、自分のGPU、解像度、バッチ、ワークフローでの速度を保証しない。ライセンスもコード、モデル重み、派生物、商用規模で条件が異なり得る。ダウンロード前に配布ページの現行ライセンスを読む。
実務上の限界
画像生成は、ムードボード、広告ラフ、製品の背景置換、教育図の下絵、ゲームの探索には有効だが、医療・報道・証拠・人物同定の正確さを保証しない。実在人物の肖像、既存キャラクター、ブランド、建築や商品の正確な形状は、利用権と検証が必要である。生成器が見栄えよく補った細部は、事実とは限らない。
良い工程は、モデルに全部を描かせない。構図と被写体を候補生成で探し、承認された要素を参照・マスク・レイヤー編集で固定し、文字と法的表記を決定的な編集で置く。画像生成の性能が上がるほど、この分業は小さく見える。しかし公開品質は、最後に残った小さな誤りで決まる。
画像を一回の出力から資産へ変える
採用画像には完成JPEGだけでなく、入力参照、条件文、マスク、制御画像、seedまたは出力ID、生成日時、モデル版、後編集レイヤーを関連づける。翌週に同じキャンペーンの色だけを変える依頼へ安全に答えるには、ピクセルではなく判断の履歴が要る。条件を強くするほど自由度は下がるため、探索段階では条件を少なくし、承認後に参照、構図制御、局所編集を増やす。
- 1探索: 少ない条件で候補の幅を出す
- 2承認: 構図と被写体を決める
- 1固定: 参照/マスク/controlを増やす
- 2編集: 正確な文字を置く
- 1保存: 入力と承認理由を紐づける
- 2次回に再利用する
最後に、実際の媒体で検査する。スマートフォン、モニター、印刷では暗部と彩度が違う。小画面で商品名が読めるか、白背景で切り抜きの縁が見えないか、代替テキストが用途を説明できるかを確認する。モデル内部の理解は役立つが、届ける媒体で読めることの方が成果を決める。
誤りの原因を画像の層ごとに分ける
「結果が違う」という感想を、構図、被写体、属性、局所、文字の五層に分ける。構図ならクロップ、カメラ位置、前景と背景の比率を見る。被写体なら参照の角度と数を見る。属性なら色、素材、衣服、小道具を一つずつ確認する。局所ならマスクを狭め、周囲に影と反射の余白を残す。文字なら生成結果を直そうとせず、正しいレイヤーへ置き換える。この順序なら、全体を再生成する前に直せる問題を見分けられる。
例えば「白いマグカップを手前に、青い壁を後ろに、上部へコピー余白を残す」広告ラフを作る。最初の候補で余白がない場合、文を長くしても構図が安定しないなら、ラフの矩形や輪郭制御を追加する。マグの取っ手が不自然なら、カップ全体ではなく手元をマスク編集する。商品名が歪むなら、生成を繰り返さず決定済みの文字レイヤーを合成する。生成器が得意な連続的な見た目と、人が決めるべき離散的な事実を分けると修正回数が減る。
- 1違和感を発見
- 2構図/被写体/属性/局所/文字に分類
- 1構図・被写体
- 2参照またはcontrolを直す
- 1局所
- 2マスク編集
- 3文字
- 4決定レイヤーへ置換
- 1再出力
- 2媒体別チェック
- 3採用理由を保存
2024〜2026:品質は編集システムの問いへ
Stable Diffusion 3.5(2024)は日付付きの節目であり、現在の順位ではない。実務上の流れは、生成器を mask、reference、layout 制約、revision history と一緒に評価することにある。2026年9月の OpenAI の画像発表は現在の製品観測だが、diffusion や flow matching の理論を証明しない。アーキテクチャ説明とサービス提供を分け、文字描画、構図制約、局所修正を別タスクとして採点する。
MENTAL MODEL / 考える順序
一度に、すべてを変えない。
何を伝える画像か。媒体とサイズ、残したい意味を先に決める。
出典
01自分のノート