目安: 50分。演習の状態: 未実行 (not-run)。本文は学習ガイドであり、動作や品質の実測記録ではありません。

前提となる章: 医療用語を扱う:出典・否定・単位・人の評価

独自の概念図。矢印は依存関係や判断の順序を示し、性能の実測を表さない。

  1. 1権利と出力形式
  2. 2小さい生成試行
  3. 3制作ソフトで修正
  4. 4メッシュや画像の検査
  5. 5利用先での納品
順序と役割を、ひとつずつ分けて考える

学習目標

  • LLMと画像生成で支配的な設定が違うと説明できる
  • 3D成果物の検証を生成モデルの評価と分ける

仕事の役割

  • 学習者: 仮説・データ・評価を設計する
  • モデル: 指定した変換を試す
  • アプリ: 制限・検証・権限を保証する

入力 → 工程 → 出力

入力 工程 出力
権利を確認したprompt・画像・3D素材と設定 生成→制作ソフトでの修正→用途に合わせた検査 画像または3D assetと生成条件・権利記録

画像は解像度と同時数も重要

画像生成には、テキスト条件に加えて画像エンコーダー、ノイズ除去器(denoiser)、デコーダーなどが関わる場合がある。解像度、同時に生成する枚数(batch)、生成ステップ数、精度、補助モデル、拡大処理もメモリや計算量に影響する。設定とともに秒/枚とピークメモリを記録し、LLMのtoken/secとは別に比較する。

Apple MPS対応のDiffusers経路はあるが、個々のpipelineや演算の対応を確認する。24GB/32GBで一部の画像生成ができることから、大型動画モデルや画像学習も快適と推定してはいけない。まず小さい解像度、batch 1、単一pipelineから検証する。

DiffusersのMPS文書 はApple Silicon向けの画像pipelineの経路とbatch推論の制限を示す。LLMの結果から動画や3D全体の対応を推定せず、pipelineごとに確認する根拠になる。

3Dには生成後の工程がある

文章や画像から3Dを作るモデルは、方式によってメッシュ、テクスチャ、点群などを出力する。画像としての見栄えとは別に、メッシュが閉じているか、ポリゴン数が適切か、UVとマテリアルが整っているか、リグやアニメーションに使えるかを確認する。

生成、修正、retopology、texture調整、書き出し、engine内の表示という工程を分ける。3Dモデルの機械学習に必要なデータと、完成した3D assetを制作ソフトで加工する作業も区別する。CUDA限定の研究実装をMacで無理に動かすより、必要な段階だけGPU基盤へ移す判断が現実的な場合がある。

制作編への接続

ローカルAI編では「モデルと入力、計算、出力、評価」の共通構造を学ぶ。制作編ではその出力を画像・映像・3D作品へ仕上げる手順を読む。同じ実験台帳を使い、未実行の目安、計算上の推定、実測した値を混ぜない。

画像や3Dの入力には権利、人物の同意、公開範囲の問題もある。手元で生成できることと、配布・商用利用できることを別に確認する。処理速度だけでなく、目的のassetとして修正可能か、書き出し後に使えるかを完成条件にする。

自分で進める工程

  1. 出力形式と利用先を決める
  2. 必要なモデル部品を列挙する
  3. 小さい設定でピークメモリを測る
  4. 生成品質と制作上の使いやすさを分けて評価する
  5. 制作編の仕上げ工程へ進む

品質を確認する

  • LLMと画像生成で支配的な設定が違うと説明できる
  • 3D成果物の検証を生成モデルの評価と分ける
  • 画像がきれいというだけで3D完成と判断していないか

失敗を切り分ける

注意すること 具体的な確認方法
LLMのメモリ目安を画像/動画/3Dへそのまま流用しない 対象の処理について、解像度、batch、生成ステップ数、補助モデル、ピークメモリを記録する。
未確認のMac対応や処理速度を保証しない 使う処理系と演算の対応を確認し、小さい設定で実機の結果を記録する。

演習: 画像・3DとローカルAIをつなぐ

状態: 未実行 (not-run)。

画像1枚とゲーム用3D assetを例に、生成後に必要なチェックを3項目ずつ書く

提出するもの: 生成の成功条件と納品の成功条件の比較

完了の確認: 画像がきれいというだけで3D完成と判断していないか

実験記録用ワークシートに計画・条件・観察を記録する。未測定値は null とし、推定値は式と仮定を残します。

制作工程へつなぐ

AIクリエイティブ制作編: 画像・3Dの実制作と仕上げへ。

MENTAL MODEL / メモリ

モデルの重さを、分けて考える。

重みとKVキャッシュは別々に増える。下の値は設計用の概算です。

4.5 GB重み 4.0 GB + KV 0.5 GB

GBは10⁹ byte。KVは32層・8 KV heads・128 head dim・FP16・batch 1の仮定。量子化メタデータ、実行バッファ、OS、モデル固有の構造は別途必要。MoEでは総重みとactive parametersを分けます。

出典

公開日は資料の日付、確認日は内容を参照した日です。コミュニティの観測は公式の確定事項と区別します。

01
Diffusers Apple MPS 最適化 ↗huggingface.co公開: 不明 · 確認: 2026-10-03
02
Apple MLX ドキュメント公開: 不明 · 確認: 2026-10-03
このブラウザ内に保存します。