目安: 35分。演習の状態: 未実行 (not-run)。本文は学習ガイドであり、動作や品質の実測記録ではありません。

前提となる章: 24GB・32GB Macのメモリを見積もる

独自の概念図。矢印は依存関係や判断の順序を示し、性能の実測を表さない。

  1. 1元モデルのカードとライセンス
  2. 2変換版の公開者
  3. 3形式とruntimeの対応
  4. 4revisionを固定した記録
順序と役割を、ひとつずつ分けて考える

学習目標

  • モデルIDとrevisionを記録する
  • MLX、GGUF、safetensorsの役割を区別する

仕事の役割

  • 学習者: 仮説・データ・評価を設計する
  • モデル: 指定した変換を試す
  • アプリ: 制限・検証・権限を保証する

入力 → 工程 → 出力

入力 工程 出力
モデルID、モデルカード、ライセンス、ファイル一覧 出所・互換性・用途条件・容量を確認する 採用候補の台帳と固定revision

Hubはモデルの配布と記録の場所

Hugging Face Hubにはモデル、データセット、アプリがある。モデルページでは、公開者、元モデル、用途、制約、ライセンス、必要なライブラリ、ファイルサイズを確認する。比較に使ったコミットのrevisionを保存して固定すれば、更新されるmainブランチとの違いを追いやすい。

本教材の小型例はQwen/Qwen2.5-0.5B-Instructと、そのコミュニティ変換版mlx-community/Qwen2.5-0.5B-Instruct-4bitである。存在と公式掲載の使い方を確認した例であり、最新または最良のモデルという意味ではない。変換版の公開者と元モデルの開発者は同一ではない。

元のQwenカード と MLXコミュニティ変換版 を比べる。変換版には元モデルとmlx-lm 0.18.1による変換が記されている。この版は変換時の来歴で、現在使うruntimeの必須版という意味ではない。Hubのモデルカード指針 はライセンスや用途の記録の役割を説明する。

本教材は2024年9月のQwen2.5系列を、小さく再現条件を確認しやすい学習候補として残す。年月はモデルカードにある系列の引用情報に基づき、2026年10月の最新モデルという主張ではない。後のモデルを選ぶ場合も、そのライセンス、ファイル、revision、評価を別途確認する。Qwen2.5モデルカード。

保存形式と実行環境を揃える

safetensorsはtensorの保存形式であり、それだけでどのランタイムでも動くとは限らない。Transformersはモデル構造と設定を読み、MLX LMは対応するMLX形式を使う。llama.cppでは対応するGGUFを使う。拡張子だけを変えても変換にはならない。

LoRA adapterは通常、小さな追加重みであり単体で会話できない。どのbase model、revision、target modules、tokenizerに対するものかを保持する。量子化版と非量子化版、adapterの組み合わせを変更したら、元の評価結果を流用せず再評価する。

ライセンスとダウンロードの安全性

公開されていること、無料で取得できること、商用サービスに組み込めることは別である。元モデルと派生モデル、datasetそれぞれの条件を読む。再配布、表示義務、用途制限などがある場合は守り、規約が不明なら公開を止める。

未知のモデルのためにtrust_remote_code=Trueを安易に指定しない。モデル読み込み時の独自コードは実行され得る。安全な保存形式を優先しても、パッケージや実行コードまで安全と保証されるわけではない。まず公式例・既知のモデル・通常権限の隔離環境で進め、ダウンロード容量と保存先を確認する。

自分で進める工程

  1. 公式または確認できる公開者から選ぶ
  2. 元モデルまで辿る
  3. ライセンスを保存する
  4. ファイルとランタイムの対応を確認する
  5. revisionとパッケージ版を実験台帳に残す

品質を確認する

  • モデルIDとrevisionを記録する
  • MLX、GGUF、safetensorsの役割を区別する
  • モデルカードの能力主張と自分の実測結果を分けたか

失敗を切り分ける

注意すること 具体的な確認方法
open weightsと制約なしのopen sourceを同義にしない 元モデルと変換版のライセンスを読み、再配布や用途の制限を確認する。
第三者のベンチマーク値を手元の速度として転載しない 提供者のベンチマークと分けて、自分の機種、ランタイム、入力、結果を記録する。

演習: Hugging Faceとモデルファイルの読み方

状態: 未実行 (not-run)。

教材の元モデルとMLX変換版を比較し、異なる公開者・形式・量子化の有無をまとめる

提出するもの: モデル採用カード1枚

完了の確認: モデルカードの能力主張と自分の実測結果を分けたか

実験記録用ワークシートに計画・条件・観察を記録する。未測定値は null とし、推定値は式と仮定を残します。

MENTAL MODEL / メモリ

モデルの重さを、分けて考える。

重みとKVキャッシュは別々に増える。下の値は設計用の概算です。

4.5 GB重み 4.0 GB + KV 0.5 GB

GBは10⁹ byte。KVは32層・8 KV heads・128 head dim・FP16・batch 1の仮定。量子化メタデータ、実行バッファ、OS、モデル固有の構造は別途必要。MoEでは総重みとactive parametersを分けます。

出典

公開日は資料の日付、確認日は内容を参照した日です。コミュニティの観測は公式の確定事項と区別します。

01
Hugging Face Model Cards ↗huggingface.co公開: 不明 · 確認: 2026-10-03
02
Qwen2.5-0.5B-Instruct モデルカード ↗huggingface.co公開: 不明 · 確認: 2026-10-03
03
MLX変換版 Qwen2.5-0.5B-Instruct-4bit ↗huggingface.co公開: 不明 · 確認: 2026-10-03
04
Transformers Auto classes ↗huggingface.co公開: 不明 · 確認: 2026-10-03
05
llama.cpp 公式リポジトリ公開: 不明 · 確認: 2026-10-03
このブラウザ内に保存します。