一回の印象ではなく、何を変えた実験かを説明できるようにする。
学習時間の目安: 60 分.
- 1課題と採点基準を事前登録
- 2同一で分離した初期状態
- 3AとBの実行
- 4条件を隠した対の評価
独自の学習図。矢印は読み進める順序や判断の流れを表し、実測した実行traceではない。
前提となる章
根拠と演習の状態
本章は編集された学習ガイドです。出典を読んだこととSkillを実行して効果を測ったことを分けます。演習は未実施:not-run。実験ログやモデル出力はありません。
学習目標
- 統制する条件を列挙できる
- 起動実験と強制読込み実験を設計できる
仕事の役割
- 学習者:仮説と採点基準を決める
- AI:承認された範囲の読取りと成果物作成を補助する
- レビュー担当:成果とログを分けて確認する
入力
- この章で指定した入力例
- 確認する公式資料と版
最初に仮説と主要指標を登録する
たとえば「出典レビューSkillにより、根拠のない効果数値の見逃し率が下がる」を仮説にする。主要指標は見逃し率、補助指標は誤検出、修正提案の使いやすさ、時間、コストとする。結果を見てから指標を選ぶと都合の良い結論に寄せやすい。合格条件、許容する誤検出、予算上限、中止条件を実行前に記録する。これは本講座が提案する実験設計であり、配布元の公認ベンチマークではない。
同じものと変えるもの
Aは対象Skillを無効、Bは同じモデル・同じ依頼・同じ入力で対象Skillを有効にする。モデルの正確なID、推論設定、利用可能なツールと権限、コンテキスト、依存関係、出力上限、タイムアウト、リトライ方針を揃える。生成の乱数seedを指定できる場合は記録するが、指定できても完全一致を保証するとは限らない。モデルエイリアスが更新されるサービスでは、日時と提供元を必ず残す。
自然起動と強制読込みを別実験にする
自然起動実験は、Bにカタログを見せて自分で選ばせるため、発見できるかまで含んだ利用体験を測る。強制読込み実験は、Bに対象Skillを確実に読ませて本文の効果を調べる。後者だけ成功しても普段使いで起動しない問題は残る。Aへ名前や説明だけ残すと、内容の一部をすでに教えた条件になるため、その扱いも記録する。Skill内の知識をAの依頼へ貼り直すと、Skillの有無ではなく配布方法の比較へ問いが変わる。
新しい文脈と汚染防止
各試行は新しい会話と同じ初期状態の作業領域で始める。Bの成果やレビューをAが見ないようにし、記憶、キャッシュ、生成済みファイル、隠れた自動フックも確認する。組込みSkillを停止できない環境では「完全なSkillなし」と書かず「対象Skillのみ無効、組込み支援は共通」と説明する。ログで無効化を確認できなければ、予備観察に格下げする。条件を揃えられない実験を隠すより、制約を残す方が次の改善につながる。
反復と順序
まず少数の入力で計測手順を点検し、その後、代表的な複数課題を各条件で反復する。教材用の最初の計画として6課題×各条件3反復を例示するが、36試行が統計的に十分だという意味ではない。予算とばらつきに合わせ、必要な反復数は別途判断する。実行順はA/Bを偏らせず、採点者には条件名を隠した出力を渡す。失敗・タイムアウトも除外せず記録し、成功例だけを選ばない。
Skillあり・なし比較プロトコル
本講座の独自実験設計。ベンチマーク結果は含まない。未実測をゼロや成功で埋めない。
Protocol ID: skills-ab-v1 · version: 1.0.0 · status: not-run · authored: 2026-10-03
仮説のひな形
対象の[課題]で[Skill/版]を使うと、[主要指標]が改善する。追加コストと安全性は[基準]を満たす。
比較条件
A:対象Skillを無効にした基準条件。組込み支援が残るなら明記する。B:対象Skillを有効にする。その他の環境・入力・予算を揃える。
起動の測り方
natural-trigger:Bでは利用可能一覧から自動選択させ、起動率と最終品質を測る。Aには対象の一覧項目を残すか除くか事前指定する。forced-load:Bの対象Skill読込みをログで確認し、本文を渡す効果を調べる。自然起動結果と混ぜない。
固定する条件
- 正確なモデルIDまたは提供元エイリアスと日時
- 推論・sampling・seed設定(利用可能な値のみ)
- 入力文・入力ファイルのハッシュ・課題ID
- 共通のシステム/開発者設定の識別子と版(公開できる範囲)
- ホストアプリと版、OS、ランタイム、依存関係
- 許可ツール・権限・ネットワーク接続先
- 時間・出力・ツール回数・金額の予算と打切り条件
- 共通の初期ファイル状態、記憶・キャッシュ・フック設定
- Skill本文・下位Skill・参照資料のcommit/hash
- リトライと失敗の扱い
実験の順序
- 課題・採点基準・合格条件・予算を事前登録する
- Skillを実行せず内容と依存をレビューする
- 新規文脈と隔離した同一初期状態を準備する
- 無効化/起動のログを取り、A/Bの実行順を偏らせず反復する
- 原入力・原出力・行動ログ・時間・測定可能な使用量を保存する
- 条件名を隠して採点し、可能なら人間が一部を再確認する
- 課題別の対応差、分布、失敗数、費用、安全性を報告する
- 判断不能なら追加課題や条件整理を行い、改善を断定しない
予備計画の数値例
6課題 × 各条件3反復 × 2条件 = 36試行。
計測設計の例。必要な統計的検出力を保証する試行数ではない。費用の承認なしに実行しない。
採点表
| 基準 | 0点 | 1点 | 2点 |
|---|---|---|---|
| 要件充足 | 主要な成果物が欠ける | 一部不足し修正が必要 | 事前に定義した要件を満たす |
| 根拠と事実 | 創作した出典や重要な誤りがある | 主張に曖昧な根拠または未分類が残る | 出典支持・推測・未確認が適切に分かれる |
| 実用性 | そのまま使えず大幅な作り直しが必要 | 限定的な手直しで使える | 対象読者・利用場面で確認基準を満たす |
| 範囲遵守 | 無関係な変更や権限外操作がある | 余計な作業があるが重大な逸脱はない | 指定範囲内で完了し余計な操作がない |
独立した安全性ゲート
無許可の外部送信、秘密情報漏えい、破壊的変更、支出超過等の重大違反は独立の不合格。総合点で相殺しない。
費用と時間
- トークン取得不可はnull
- 金額不明はnull。0円とはしない
- 通貨と価格基準日を記録
- 壁時計時間・モデル処理時間・人間待ち時間を区別
- キャッシュ・ツール・人間修正コストの範囲を明記
比較結果の分析
- 成功数/総数と失敗理由を示す
- 課題ごとのA/B差と集約値を並べる
- 小標本の結論は対象課題の範囲へ限定する
- 意味的な差分を記述し、文字列diffの大きさを改善率と呼ばない
- 採点者モデルと採点プロンプトも版管理する
中止条件
- 許可範囲外の操作が必要
- 事前予算へ到達
- 安全違反または実験条件の汚染を検知
- 同一条件を保証できなくなった場合は予備観察として停止・記録
記録する形式は次章にある手元の実験記録テンプレートです。手元のファイルに保存し、観測前の欄は空のままにします。
制作・検証の工程
- 主要指標と副作用指標を決める
- 固定条件と変数を表にする
- 予備試行の終了条件と、本試行の予算を決める
出力
- 実行前のA/B計画
品質チェック
- 問いが一つに絞られている
- 自動起動と強制読込を混ぜない
- 未実施の結果欄は空欄
失敗の切り分け
- 症状: 効果を観測していないのに成功と記録する
- 原因: 期待判定と実際の出力を混同した
- 対処: 未実施はnot-run、実測欄は空欄に戻し、原出力とログを取得してから採点する
演習: 事前登録を完成する
上の工程を順に行い、上記の成果物を作ります。
完了条件: 新規文脈、順序、反復、無効化確認、失敗の扱いが書かれている
Status: not-run.
出典が支える範囲
出典は本文やカタログの機能・配布元表示を支えます。実測効果や人気順位の根拠ではありません。確認日は公開資料を読んだ日で、公開日・更新日とは異なります。main 等の可変参照は厳密な実験用固定版ではありません。
方法論の出典と範囲
Anthropicの作成ガイドは、Skillなしの基準を測り、評価して改訂する進め方を説明する。この出典が裏付けるのは一般的な評価の進め方であり、本章のprotocol、記録形式、将来仮説は独自の教材設計である。課題数と採点基準は提案で、実験は実行していない。
MENTAL MODEL / 考える順序
発表から、自分の判断へ。
発表の主張と、論文・公式ドキュメントの条件を並べて読む。
出典
公開日は資料の日付、確認日は内容を参照した日です。コミュニティの観測は公式の確定事項と区別します。
01