目安: 50分。演習の状態: 未実行 (not-run)。本文は学習ガイドであり、動作や品質の実測記録ではありません。
前提となる章: 日本語に適応する:語彙・表記・タスク
独自の概念図。矢印は依存関係や判断の順序を示し、性能の実測を表さない。
- 1公開用語と架空文
- 2根拠検索
- 3否定・単位・時点を保持
- 4専門家が誤りを確認
学習目標
- 医療用語RAGの評価項目を作れる
- 患者データを使わず安全に試作する
仕事の役割
- 学習者: 仮説・データ・評価を設計する
- モデル: 指定した変換を試す
- アプリ: 制限・検証・権限を保証する
入力 → 工程 → 出力
| 入力 | 工程 | 出力 |
|---|---|---|
| 利用条件の明確な用語資料と架空例 | 根拠検索→候補提示/構造化→専門家評価 | 出典付き用語候補、未確定表示、誤り分類 |
対象を用語と文書処理に限定する
ここでの初期用途は、公開された用語の検索、略語候補の提示、架空文書からの用語抽出、原文に忠実な整理である。診断や治療の推奨、患者ごとの判断が安全になることを証明する教材ではない。読みやすい出力が臨床的に正しいとは限らない。
用語集には名称、同義語、略語、出典、版、利用条件を付ける。同じ略語が分野で異なる意味を持つ場合は候補と根拠を提示し、文脈不足なら確定しない。公開資料であっても再利用条件と更新状況を確認する。
患者情報を最初の実験へ入れない
この教材の演習は患者情報をアップロードせず、架空例または再利用条件が明確な公開用語だけで行う。実データを扱う段階では組織の責任者、法務・倫理・情報管理の手順と、適用される地域の制度を確認する。ローカル実行は漏洩面を減らす一手段であり、適法性や安全性の証明ではない。
氏名を消すだけで匿名になるとは限らない。日付、地域、希少な出来事、自由記述の組み合わせから個人が特定される可能性がある。米国HHSのde-identification guidanceは再識別リスクを考える参考だが、日本など他地域の法的要件を置き換えるものではない。モデル、adapter、cache、ログにも情報が残り得るため、保存範囲とアクセスを設計する。
HHS指針 は米国HIPAAにおけるExpert DeterminationとSafe Harbor、および残る再識別リスクを説明する。日本での適法性を証明する資料ではない。WHOの医療用大規模マルチモーダルモデル指針 は用途の境界を考えるガバナンス資料で、本試作の臨床的有効性の証拠ではない。
一般的な正答率で見落とす失敗
「所見あり」と「所見なし」、「疑い」と「確定」、「既往」と「現在」、「患者本人」と「家族」の違いを保持できるかを個別に採点する。数値、小数点、桁、単位、時刻、左右、否定の係り先は、文章の流暢さより重要な場合がある。
例として架空文「検査値Aは3.0 mg/L。前回は2.0 mg/L。症状Bは認めない」を使う。期待する出力は値と時点を保持し、否定を反転させず、病名や重症度を追加しないことである。これは医学的な正常範囲や診断を示す例ではない。
専門家評価と使用範囲を結び付ける
用語の専門家が評価基準を作り、重大な誤りを分けてレビューする。引用元と出力の一致、未収録用語での棄権、表記ゆれ、施設や時期が変わったデータでの性能を確認する。平均点が良くても重大な否定反転が残れば用途を制限する。
RAGや追加学習の後も、モデルの断言を医療判断へ自動接続しない。訂正できる画面、原文へのリンク、モデル版、監査に必要な最小限の記録を用意する。臨床利用を検討する場合は別途その用途に適した検証と承認が必要である。
自分で進める工程
- 患者情報を使わない範囲を固定する
- 用語資料の出典と版を登録する
- 否定・時点・単位・主体の評価例を作る
- 専門家が重大誤りを定義する
- 用途外の判断を生成しないかを確かめる
品質を確認する
- 医療用語RAGの評価項目を作れる
- 患者データを使わず安全に試作する
- 否定反転、単位欠落、根拠のない補完を別件として記録したか
失敗を切り分ける
| 注意すること | 具体的な確認方法 |
|---|---|
| 医療ベンチマークの得点を診断能力の保証として使わない | 演習は公開用語と架空文書に限る。臨床利用には別途、その用途の検証と承認が必要になる。 |
| 匿名化済みという申告だけで共有や学習を開始しない | 開始前に利用許可、出典、共有・学習に使う範囲を確認する。 |
| 患者データを公開Hub・外部ログ・課金APIへ送らない | この演習には公開または架空の入力を使い、出力やログに何が残るか確認する。 |
演習: 医療用語を扱う:出典・否定・単位・人の評価
状態: 未実行 (not-run)。
架空文から「値」「単位」「時点」「否定」「根拠文」を抽出する評価を作る
提出するもの: 診断を含まない構造化例と専門家レビュー用採点表
完了の確認: 否定反転、単位欠落、根拠のない補完を別件として記録したか
実験記録用ワークシートに計画・条件・観察を記録する。未測定値は null とし、推定値は式と仮定を残します。
MENTAL MODEL / メモリ
モデルの重さを、分けて考える。
重みとKVキャッシュは別々に増える。下の値は設計用の概算です。
GBは10⁹ byte。KVは32層・8 KV heads・128 head dim・FP16・batch 1の仮定。量子化メタデータ、実行バッファ、OS、モデル固有の構造は別途必要。MoEでは総重みとactive parametersを分けます。
出典
公開日は資料の日付、確認日は内容を参照した日です。コミュニティの観測は公式の確定事項と区別します。
01