目安: 35分。演習の状態: 未実行 (not-run)。本文は学習ガイドであり、動作や品質の実測記録ではありません。
前提となる章: 24GB・32GB Macのメモリを見積もる
独自の概念図。矢印は依存関係や判断の順序を示し、性能の実測を表さない。
- 1元モデルのカードとライセンス
- 2変換版の公開者
- 3形式とruntimeの対応
- 4revisionを固定した記録
学習目標
- モデルIDとrevisionを記録する
- MLX、GGUF、safetensorsの役割を区別する
仕事の役割
- 学習者: 仮説・データ・評価を設計する
- モデル: 指定した変換を試す
- アプリ: 制限・検証・権限を保証する
入力 → 工程 → 出力
| 入力 | 工程 | 出力 |
|---|---|---|
| モデルID、モデルカード、ライセンス、ファイル一覧 | 出所・互換性・用途条件・容量を確認する | 採用候補の台帳と固定revision |
Hubはモデルの配布と記録の場所
Hugging Face Hubにはモデル、データセット、アプリがある。モデルページでは、公開者、元モデル、用途、制約、ライセンス、必要なライブラリ、ファイルサイズを確認する。比較に使ったコミットのrevisionを保存して固定すれば、更新されるmainブランチとの違いを追いやすい。
本教材の小型例はQwen/Qwen2.5-0.5B-Instructと、そのコミュニティ変換版mlx-community/Qwen2.5-0.5B-Instruct-4bitである。存在と公式掲載の使い方を確認した例であり、最新または最良のモデルという意味ではない。変換版の公開者と元モデルの開発者は同一ではない。
元のQwenカード と MLXコミュニティ変換版 を比べる。変換版には元モデルとmlx-lm 0.18.1による変換が記されている。この版は変換時の来歴で、現在使うruntimeの必須版という意味ではない。Hubのモデルカード指針 はライセンスや用途の記録の役割を説明する。
本教材は2024年9月のQwen2.5系列を、小さく再現条件を確認しやすい学習候補として残す。年月はモデルカードにある系列の引用情報に基づき、2026年10月の最新モデルという主張ではない。後のモデルを選ぶ場合も、そのライセンス、ファイル、revision、評価を別途確認する。Qwen2.5モデルカード。
保存形式と実行環境を揃える
safetensorsはtensorの保存形式であり、それだけでどのランタイムでも動くとは限らない。Transformersはモデル構造と設定を読み、MLX LMは対応するMLX形式を使う。llama.cppでは対応するGGUFを使う。拡張子だけを変えても変換にはならない。
LoRA adapterは通常、小さな追加重みであり単体で会話できない。どのbase model、revision、target modules、tokenizerに対するものかを保持する。量子化版と非量子化版、adapterの組み合わせを変更したら、元の評価結果を流用せず再評価する。
ライセンスとダウンロードの安全性
公開されていること、無料で取得できること、商用サービスに組み込めることは別である。元モデルと派生モデル、datasetそれぞれの条件を読む。再配布、表示義務、用途制限などがある場合は守り、規約が不明なら公開を止める。
未知のモデルのためにtrust_remote_code=Trueを安易に指定しない。モデル読み込み時の独自コードは実行され得る。安全な保存形式を優先しても、パッケージや実行コードまで安全と保証されるわけではない。まず公式例・既知のモデル・通常権限の隔離環境で進め、ダウンロード容量と保存先を確認する。
自分で進める工程
- 公式または確認できる公開者から選ぶ
- 元モデルまで辿る
- ライセンスを保存する
- ファイルとランタイムの対応を確認する
- revisionとパッケージ版を実験台帳に残す
品質を確認する
- モデルIDとrevisionを記録する
- MLX、GGUF、safetensorsの役割を区別する
- モデルカードの能力主張と自分の実測結果を分けたか
失敗を切り分ける
| 注意すること | 具体的な確認方法 |
|---|---|
| open weightsと制約なしのopen sourceを同義にしない | 元モデルと変換版のライセンスを読み、再配布や用途の制限を確認する。 |
| 第三者のベンチマーク値を手元の速度として転載しない | 提供者のベンチマークと分けて、自分の機種、ランタイム、入力、結果を記録する。 |
演習: Hugging Faceとモデルファイルの読み方
状態: 未実行 (not-run)。
教材の元モデルとMLX変換版を比較し、異なる公開者・形式・量子化の有無をまとめる
提出するもの: モデル採用カード1枚
完了の確認: モデルカードの能力主張と自分の実測結果を分けたか
実験記録用ワークシートに計画・条件・観察を記録する。未測定値は null とし、推定値は式と仮定を残します。
MENTAL MODEL / メモリ
モデルの重さを、分けて考える。
重みとKVキャッシュは別々に増える。下の値は設計用の概算です。
GBは10⁹ byte。KVは32層・8 KV heads・128 head dim・FP16・batch 1の仮定。量子化メタデータ、実行バッファ、OS、モデル固有の構造は別途必要。MoEでは総重みとactive parametersを分けます。
出典
公開日は資料の日付、確認日は内容を参照した日です。コミュニティの観測は公式の確定事項と区別します。
01