目安: 35分。演習の状態: 未実行 (not-run)。本文は学習ガイドであり、動作や品質の実測記録ではありません。

前提となる章: モデル・token・推論を理解する

独自の概念図。矢印は依存関係や判断の順序を示し、性能の実測を表さない。

  1. 1元文書で分割
  2. 2学習データ
  3. 3重みの更新
  4. 4独立した評価
  1. 1未学習のtestデータ
  2. 2固定採点
  3. 3改善と退行
順序と役割を、ひとつずつ分けて考える

学習目標

  • forward、loss、backward、optimizerの役割を言える
  • train/validation/testを漏洩なく分ける

仕事の役割

  • 学習者: 仮説・データ・評価を設計する
  • モデル: 指定した変換を試す
  • アプリ: 制限・検証・権限を保証する

入力 → 工程 → 出力

入力 工程 出力
利用権のある学習例と独立した評価例 予測→損失→勾配→更新→固定評価 checkpoint/adapter、学習ログ、用途別の評価結果

学習は間違いを数値化して重みを動かす

教師あり学習では入力と正解の組を使う。forwardで予測し、lossで正解との差を数値化し、backwardで各重みに対する勾配を計算し、optimizerが重みを更新する。LLMの事前学習では、文章中の次のtokenを正解にする自己教師あり学習が中心となる。

推論では通常、勾配とoptimizerの状態を保持しない。学習ではそれらと中間計算のactivationが必要になるため、「モデルのファイルがメモリに入る」ことは「そのモデルを学習できる」ことを意味しない。

TRL SFTTrainer文書 はtrainerのデータ形式とloss設定を説明する。MLX LMのLoRA/QLoRA学習手順はApple Silicon側の別の実装資料であり、作者の掲載例を本教材の実測結果へ置き換えない。

基本語を実験のつまみにする

epochはデータ全体を何周するか、batch sizeは一度に扱う例の数、learning rateは更新の大きさを調整する値である。gradient accumulationは小さなbatchの勾配を複数回蓄積してから更新する方法で、同時に保持する例を増やさず実効batchを増やせる。seedを記録しても、異なる機器や実装をまたいで完全一致するとは限らない。

train lossだけが下がり未知の例への性能が悪くなるのが過学習の典型である。複雑なモデルの前に少数の例を目視すること、重複を除くこと、正解ラベルの曖昧さを直すことの方が改善につながる場合も多い。

評価セットは作業開始前に固定する

trainは学習、validationは設定選択、testは最後の比較に使う。文書の断片をランダム分割すると同じ文書が両側に入り、実力を過大評価しやすい。元文書・利用者・時期など、本番の未知性に合わせた単位で分割する。

lossやperplexityは言語モデルとしての予測の尺度であり、業務で安全かどうかの直接の証明ではない。形式遵守率、根拠の一致、必要事項の抜け、誤答時の棄権、処理時間を別々に測る。モデル自身による採点は補助にとどめ、採点者の偏りと専門家の確認を考える。

自分で進める工程

  1. 用途に合う失敗分類を作る
  2. 元文書単位でデータを分割する
  3. 学習前の基準性能を保存する
  4. 一度に一つの設定だけ変える
  5. 改善と退行の両方を見る

品質を確認する

  • forward、loss、backward、optimizerの役割を言える
  • train/validation/testを漏洩なく分ける
  • 20問の結果を一般的な性能保証として扱っていないか

失敗を切り分ける

注意すること 具体的な確認方法
学習データと同じ問題で改善を証明しない 元の文書単位でデータを分割し、重複を確認してから未学習のデータで評価する。
小さな評価セットの差を統計的に確かな差と断言しない 評価セットの件数と失敗例を、点数の差とともに示す。

演習: 学習・損失・評価の基本

状態: 未実行 (not-run)。

出力形式、事実の一致、棄権、速度の4観点で20問の小さなテストを設計する

提出するもの: 正解・採点基準・除外条件のある評価セット

完了の確認: 20問の結果を一般的な性能保証として扱っていないか

実験記録用ワークシートに計画・条件・観察を記録する。未測定値は null とし、推定値は式と仮定を残します。

MENTAL MODEL / メモリ

モデルの重さを、分けて考える。

重みとKVキャッシュは別々に増える。下の値は設計用の概算です。

4.5 GB重み 4.0 GB + KV 0.5 GB

GBは10⁹ byte。KVは32層・8 KV heads・128 head dim・FP16・batch 1の仮定。量子化メタデータ、実行バッファ、OS、モデル固有の構造は別途必要。MoEでは総重みとactive parametersを分けます。

出典

公開日は資料の日付、確認日は内容を参照した日です。コミュニティの観測は公式の確定事項と区別します。

01
TRL SFTTrainer ↗huggingface.co公開: 不明 · 確認: 2026-10-03
02
MLX LM LoRA/QLoRA 学習手順公開: 不明 · 確認: 2026-10-03
このブラウザ内に保存します。