目安: 50分。演習の状態: 未実行 (not-run)。本文は学習ガイドであり、動作や品質の実測記録ではありません。
前提となる章: 継続事前学習・選好最適化と選び方
独自の概念図。矢印は依存関係や判断の順序を示し、性能の実測を表さない。
- 1日本語の原文
- 2元へ辿れる正規化
- 3tokenizerと検索の確認
- 4意味を保持した出力
- 5用途別採点
学習目標
- tokenizerと表記ゆれが効率・品質に与える影響を調べる
- 日本語適応を語学教育用途と混同しない
仕事の役割
- 学習者: 仮説・データ・評価を設計する
- モデル: 指定した変換を試す
- アプリ: 制限・検証・権限を保証する
入力 → 工程 → 出力
| 入力 | 工程 | 出力 |
|---|---|---|
| 日本語の実用途を模した公開・自作データと用語集 | 分割と正規化を観察→方式選択→評価 | 表記・意味・形式別の改善結果 |
何を日本語化するのか
ここで扱う日本語適応は、日本語のサービスや業務データをモデルが適切に扱えるようにすることである。日本語学習者への語学指導だけを意味しない。漢字・かな・英数字混在、略語、敬体と常体、縦書きOCR、表記ゆれなど、対象サービス固有の課題を選ぶ。
多言語モデルのカードに日本語対応と書かれていても、特定分野の精度を保証するものではない。一般会話が自然なモデルでも、製品型番、契約条件、専門略語の区別は弱いことがある。まず実際の入力に似た短い評価を作る。
Qwenの例示モデルカード は対応言語に日本語を挙げる。これは提供元によるモデル群の説明であり、以下の表記・専門用語・課題の評価は手元で行う未実行の計画である。
tokenizerと正規化を観察する
日本語の語句が細かく分割されると、同じ内容でもcontextと処理量を多く消費する場合がある。実際に候補モデルでtoken数を比較し、速度だけでなく意味を保持できるかを測る。tokenizerを追加・変更することは設定一つの軽い修正ではなく、embeddingの学習や互換性の問題を伴う。
全角半角や表記を揃える処理は検索を助けるが、安易な正規化で型番、単位、記号の意味を失うことがある。原文と正規化後を両方保持し、元へ辿れるようにする。同義語辞書は用語の候補を増やすために使い、異なる概念を勝手に同一視しない。
日本語の評価を具体化する
評価例には漢字とかなの揺れ、略語、否定、二重否定、主語省略、数値と単位、固有名詞を含める。敬語が自然かだけで採点せず、元の条件が保存されたか、未知の語を推測せず確認できるかを見る。
専門語を知りたいだけならまず出典付き辞書RAGを試す。出力の言い回しや構造を揃える必要があればSFTが候補になる。大量の専門コーパスへの適応は別の段階で検討する。データを集めるほど良くなると決めず、権利、重複、出典、誤記を先に確かめる。
自分で進める工程
- 用途の日本語特徴を列挙する
- 原文保持の正規化を設計する
- 候補モデルのtoken数を比較する
- 辞書/RAGとpromptを先に試す
- 追加学習は改善対象を限定して行う
品質を確認する
- tokenizerと表記ゆれが効率・品質に与える影響を調べる
- 日本語適応を語学教育用途と混同しない
- 見た目の一致だけでなく意味の保存を採点したか
失敗を切り分ける
| 注意すること | 具体的な確認方法 |
|---|---|
| 日本語対応という記載を専門領域の合格証にしない | 専門分野の略語、表記、課題ごとの要件を個別に評価する。 |
| 語彙を追加すれば即座に理解できるとは考えない | 同じ課題で適応の前後を比べ、用語の誤用も確認する。 |
演習: 日本語に適応する:語彙・表記・タスク
状態: 未実行 (not-run)。
同じ意味の表記ゆれ5組と、似ているが意味が違う5組を自作する
提出するもの: 検索と回答を分けた10組の評価
完了の確認: 見た目の一致だけでなく意味の保存を採点したか
実験記録用ワークシートに計画・条件・観察を記録する。未測定値は null とし、推定値は式と仮定を残します。
MENTAL MODEL / メモリ
モデルの重さを、分けて考える。
重みとKVキャッシュは別々に増える。下の値は設計用の概算です。
GBは10⁹ byte。KVは32層・8 KV heads・128 head dim・FP16・batch 1の仮定。量子化メタデータ、実行バッファ、OS、モデル固有の構造は別途必要。MoEでは総重みとactive parametersを分けます。
出典
公開日は資料の日付、確認日は内容を参照した日です。コミュニティの観測は公式の確定事項と区別します。
01