目安: 50分。演習の状態: 未実行 (not-run)。本文は学習ガイドであり、動作や品質の実測記録ではありません。
前提となる章: 医療用語を扱う:出典・否定・単位・人の評価
独自の概念図。矢印は依存関係や判断の順序を示し、性能の実測を表さない。
- 1権利と出力形式
- 2小さい生成試行
- 3制作ソフトで修正
- 4メッシュや画像の検査
- 5利用先での納品
学習目標
- LLMと画像生成で支配的な設定が違うと説明できる
- 3D成果物の検証を生成モデルの評価と分ける
仕事の役割
- 学習者: 仮説・データ・評価を設計する
- モデル: 指定した変換を試す
- アプリ: 制限・検証・権限を保証する
入力 → 工程 → 出力
| 入力 | 工程 | 出力 |
|---|---|---|
| 権利を確認したprompt・画像・3D素材と設定 | 生成→制作ソフトでの修正→用途に合わせた検査 | 画像または3D assetと生成条件・権利記録 |
画像は解像度と同時数も重要
画像生成には、テキスト条件に加えて画像エンコーダー、ノイズ除去器(denoiser)、デコーダーなどが関わる場合がある。解像度、同時に生成する枚数(batch)、生成ステップ数、精度、補助モデル、拡大処理もメモリや計算量に影響する。設定とともに秒/枚とピークメモリを記録し、LLMのtoken/secとは別に比較する。
Apple MPS対応のDiffusers経路はあるが、個々のpipelineや演算の対応を確認する。24GB/32GBで一部の画像生成ができることから、大型動画モデルや画像学習も快適と推定してはいけない。まず小さい解像度、batch 1、単一pipelineから検証する。
DiffusersのMPS文書 はApple Silicon向けの画像pipelineの経路とbatch推論の制限を示す。LLMの結果から動画や3D全体の対応を推定せず、pipelineごとに確認する根拠になる。
3Dには生成後の工程がある
文章や画像から3Dを作るモデルは、方式によってメッシュ、テクスチャ、点群などを出力する。画像としての見栄えとは別に、メッシュが閉じているか、ポリゴン数が適切か、UVとマテリアルが整っているか、リグやアニメーションに使えるかを確認する。
生成、修正、retopology、texture調整、書き出し、engine内の表示という工程を分ける。3Dモデルの機械学習に必要なデータと、完成した3D assetを制作ソフトで加工する作業も区別する。CUDA限定の研究実装をMacで無理に動かすより、必要な段階だけGPU基盤へ移す判断が現実的な場合がある。
制作編への接続
ローカルAI編では「モデルと入力、計算、出力、評価」の共通構造を学ぶ。制作編ではその出力を画像・映像・3D作品へ仕上げる手順を読む。同じ実験台帳を使い、未実行の目安、計算上の推定、実測した値を混ぜない。
画像や3Dの入力には権利、人物の同意、公開範囲の問題もある。手元で生成できることと、配布・商用利用できることを別に確認する。処理速度だけでなく、目的のassetとして修正可能か、書き出し後に使えるかを完成条件にする。
自分で進める工程
- 出力形式と利用先を決める
- 必要なモデル部品を列挙する
- 小さい設定でピークメモリを測る
- 生成品質と制作上の使いやすさを分けて評価する
- 制作編の仕上げ工程へ進む
品質を確認する
- LLMと画像生成で支配的な設定が違うと説明できる
- 3D成果物の検証を生成モデルの評価と分ける
- 画像がきれいというだけで3D完成と判断していないか
失敗を切り分ける
| 注意すること | 具体的な確認方法 |
|---|---|
| LLMのメモリ目安を画像/動画/3Dへそのまま流用しない | 対象の処理について、解像度、batch、生成ステップ数、補助モデル、ピークメモリを記録する。 |
| 未確認のMac対応や処理速度を保証しない | 使う処理系と演算の対応を確認し、小さい設定で実機の結果を記録する。 |
演習: 画像・3DとローカルAIをつなぐ
状態: 未実行 (not-run)。
画像1枚とゲーム用3D assetを例に、生成後に必要なチェックを3項目ずつ書く
提出するもの: 生成の成功条件と納品の成功条件の比較
完了の確認: 画像がきれいというだけで3D完成と判断していないか
実験記録用ワークシートに計画・条件・観察を記録する。未測定値は null とし、推定値は式と仮定を残します。
制作工程へつなぐ
AIクリエイティブ制作編: 画像・3Dの実制作と仕上げへ。
MENTAL MODEL / メモリ
モデルの重さを、分けて考える。
重みとKVキャッシュは別々に増える。下の値は設計用の概算です。
GBは10⁹ byte。KVは32層・8 KV heads・128 head dim・FP16・batch 1の仮定。量子化メタデータ、実行バッファ、OS、モデル固有の構造は別途必要。MoEでは総重みとactive parametersを分けます。
出典
公開日は資料の日付、確認日は内容を参照した日です。コミュニティの観測は公式の確定事項と区別します。
01