同じ人物を作る仕事は、顔を何度も描かせる仕事ではない

シリーズ用の人物を生成すると、最初の一枚は魅力的でも、ポーズを変えた瞬間に別人になる。これを「プロンプトが弱い」とみなして形容詞を足すほど、直したい属性と一緒に構図まで揺れやすい。制作を安定させるには、何を文章、参照、構図制御、局所編集、学習で担わせるかを分ける。

Reference は見た目の事実を運ぶ。Control は位置関係を運ぶ。Inpainting は一部だけを変える。LoRA は同じ特徴を多くの生成に持ち込むための追加学習である。似ているが代替ではない。人物の髪色を直したいだけなら、LoRAを学習する前に参照とマスク編集を試す方が、速くてデータ管理も小さい。

  1. 1キャラクター仕様
  2. 2正面/横/全身の参照集
  3. 3目的別の生成
  1. 1構図が必要
  2. 2Pose/Depth/Edge control
  1. 1一部だけ誤り
  2. 2mask
  3. 3inpainting
  4. 4再検査
  1. 1繰り返し大量利用
  2. 2同意済みデータ
  3. 3LoRA検討
順序と役割を、ひとつずつ分けて考える

reference pack を撮影台本として作る

人物なら正面・45度・横顔、全身・胸上、無表情・笑顔、服・アクセサリ・手元を集める。製品なら正面、側面、背面、素材、ロゴなしの形状、使われる状況を集める。各画像に何が確定情報かを記す。赤いジャケットは固定、背景の壁紙は可変、左頬のほくろは固定、という表である。混ざった照明や異なる衣装を同じ人物の「正解」として入れると、参照の内部に矛盾を作る。

OpenAIの画像プロンプト文書 は参照画像・マスク編集と、高い入力忠実度を選ぶ設定を説明する。これは入力細部を維持するための手段で、見えない角度を正しく再構成する保証ではない。出力が参照と違う時は、参照を増やす、欲しい画角に近い参照を使う、変化を小さくする、カットを二段階に分ける、の順に検討する。

Control は「構図をお願いする」より強い

人物の腕やカメラ位置が重要なら、文章だけで「右腕を上げる」と言うより、ポーズ骨格、深度、輪郭、ラフ絵を与える方が検査可能になる。Pose は関節の位置、Depth は前後関係、Cannyなどの輪郭は形の境界を伝える。それでも顔、服の素材、細い文字まで固定するものではない。LTX-Video の公式リポジトリがPose、Depth、Cannyの制御を案内する例は、制御が映像にも広がっていることを示すが、利用する重み・UI・版の対応は各実行環境で確認する。

  1. 1構図ラフ
  2. 2control image
  3. 3画像候補
  1. 1参照画像
  2. 2同一性条件
  3. 3画像候補
  1. 1候補
  2. 2マスクで局所修正
  3. 3レイヤーで文字/ロゴ
  4. 4承認版
順序と役割を、ひとつずつ分けて考える

Inpainting は修正を局所に閉じる

手だけ、背景の看板だけ、影だけを直したい時に、全画像を再生成するのはリスクが大きい。マスクで変更領域を指定し、残す部分を保護する。マスク境界は対象より少し広めにし、髪や影のように境界をまたぐ要素は自然につながる余地を残す。修正後はマスク外の顔、衣服、ロゴ、文字が変わっていないかを差分比較する。

文字、正しい製品型番、法的表記は、Inpaintingで何度も粘るよりデザインツールで確定レイヤーを載せる。生成は画像の土台と探索に使い、検証できる情報は決定的な手段で置く。この分業は表現を狭めない。後の改訂で安全に修正できる自由を残す。

LoRAを使う前の判断

LoRA は既存モデルの一部の重みを小さな追加パラメータとして調整し、特定の人物、衣装、画風、製品らしさを呼び出す方法として使われる。利点は、毎回たくさんの参照を送らずに一貫した傾向を出せる可能性があること。欠点は、少数・偏ったデータで姿勢や背景まで焼き付き、似た画像を過度に再生産すること、基盤モデル更新との互換性、データの権利と人物同意、配布時の利用条件である。

学習を検討する基準は、同じ被写体を何十回も使うか、参照だけで合格率が足りないか、学習用画像の利用権と削除経路があるか、評価セットを先に用意できるかである。まず10〜20枚の保留画像を評価専用に分ける。学習に使った画像で似ていると確認しても、過学習か一般化かは分からない。顔、衣服、横顔、手、異なる光、異なる背景を含む固定テストで、基盤モデル、参照、LoRAを同じ条件で比べる。

完了の定義

完成は「モデルがよく当たった」ではない。元の参照、生成設定、マスク、採用理由、編集レイヤー、利用権の記録が残り、別の人が同じシリーズの次の一枚を作れる状態である。人物・商品・ブランドを扱うほど、同一性はモデルの性能より素材と承認の管理から生まれる。

キャラクター・バイブルの最小作例

人物の同一性を「若い女性、短髪、都会的」と書くと検査できない。架空人物ユイなら、固定を肩に届く黒髪、左耳の銀色ピアス、生成りのシャツ、濃紺のジャケット、右手の細い指輪、青灰色のバックパックとする。可変は表情、姿勢、背景、時間帯、ジャケットのしわ。禁止は髪の長さ変更、ピアスの側の移動、ロゴ追加、余分な指である。正面、45度、横、全身、手元、バッグのクローズアップを対応させる。

LoRAでは訓練と評価を混ぜない。承認済み40枚を訓練、異なる照明・姿勢・背景を指定する12件を保留評価にする。基盤モデル単体、参照のみ、LoRAのみ、両方を同じ比率と構図で比較し、顔だけでなく衣服、バッグ、横顔、手を採点する。学習可能であることと、学習済み重みを配布可能であることも別である。素材の同意、削除経路、保存先、由来を先に確認する。

  1. 1人物仕様
  2. 2角度別の承認参照
  3. 3参照生成で基準を作る
  1. 1利用頻度と同意を確認
  2. 2LoRA候補
  3. 3保留評価セットで比較
  1. 1不一致
  2. 2データ/設定/用途を切り分け
  3. 3採用または参照工程へ戻る
順序と役割を、ひとつずつ分けて考える

Inpainting後は直した領域だけを見ない。マスク外の肌色、影、衣服の縫い目、背景のパースが元画像と連続するかを100%表示と最終掲載サイズで確認する。局所修正は小さな操作だが、シリーズの信頼感を決める操作でもある。

シリーズが十枚を超えたら、最終版をコンタクトシートに並べる。髪色、衣服の主色、アクセサリの位置、製品の比率を横断して見ると、一枚ずつの確認では見逃したドリフトが現れる。発見時は過去作を全て作り直す前に、今後の基準参照を更新し、公開済み資産は修正の必要性と費用を別途判断する。人物の肖像を使う場合は、参照・LoRA・出力のアクセスも分け、必要以上の個人データ保持にしない。

再利用するプロンプトには、人物固有の名前だけでなく、どの参照版とセットで使うかを書く。モデルを替えた時、同じ文が同じ意味で解釈されるとは限らないためである。月ごとの比較では、固定プロンプト、固定参照、固定評価表を使い、変化がモデル由来か素材由来かを区別する。再現性は一回のseed固定ではなく、条件と判断を残すことから生まれる。

コミュニティシグナル:反復コストはワークフローの問い

9月のコミュニティ roundup はローカル画像ツールと編集 node に触れている。これは発見シグナルであり、benchmark や安全性の主張ではない。提案された LoRA や node が、同じ制御済み reference set で反復作業を減らすかを問うために使う。base model、adapter、seed、mask、compositing step を version 化する。そうしなければ consistency の改善を再現も帰属もできない。

日付付きの2024年資料として、Stable Diffusion 3.5 は、model announcement と、別々に version 化すべき後段の adapter/reference/inpainting workflow を分けるために参照する。現在の推薦ではない。

MENTAL MODEL / 考える順序

一度に、すべてを変えない。

意図

何を伝える画像か。媒体とサイズ、残したい意味を先に決める。

出典

01
GPT Image 1 reference ↗developers.openai.com · unknown
02
LTX-Video official repository ↗github.com · unknown
03
Introducing ChatGPT Images 2.5 ↗openai.com · 2026-09-08
04
StableDiffusion community roundup (community experience) ↗www.reddit.com · 2026-10-01
05
Introducing Stable Diffusion 3.5 ↗stability.ai · 2024-10-22

自分のノート