一回の印象ではなく、何を変えた実験かを説明できるようにする。

学習時間の目安: 60 分.

  1. 1課題と採点基準を事前登録
  2. 2同一で分離した初期状態
  3. 3AとBの実行
  4. 4条件を隠した対の評価
順序と役割を、ひとつずつ分けて考える

独自の学習図。矢印は読み進める順序や判断の流れを表し、実測した実行traceではない。

前提となる章

根拠と演習の状態

本章は編集された学習ガイドです。出典を読んだこととSkillを実行して効果を測ったことを分けます。演習は未実施:not-run。実験ログやモデル出力はありません。

学習目標

  • 統制する条件を列挙できる
  • 起動実験と強制読込み実験を設計できる

仕事の役割

  • 学習者:仮説と採点基準を決める
  • AI:承認された範囲の読取りと成果物作成を補助する
  • レビュー担当:成果とログを分けて確認する

入力

  • この章で指定した入力例
  • 確認する公式資料と版

最初に仮説と主要指標を登録する

たとえば「出典レビューSkillにより、根拠のない効果数値の見逃し率が下がる」を仮説にする。主要指標は見逃し率、補助指標は誤検出、修正提案の使いやすさ、時間、コストとする。結果を見てから指標を選ぶと都合の良い結論に寄せやすい。合格条件、許容する誤検出、予算上限、中止条件を実行前に記録する。これは本講座が提案する実験設計であり、配布元の公認ベンチマークではない。

同じものと変えるもの

Aは対象Skillを無効、Bは同じモデル・同じ依頼・同じ入力で対象Skillを有効にする。モデルの正確なID、推論設定、利用可能なツールと権限、コンテキスト、依存関係、出力上限、タイムアウト、リトライ方針を揃える。生成の乱数seedを指定できる場合は記録するが、指定できても完全一致を保証するとは限らない。モデルエイリアスが更新されるサービスでは、日時と提供元を必ず残す。

自然起動と強制読込みを別実験にする

自然起動実験は、Bにカタログを見せて自分で選ばせるため、発見できるかまで含んだ利用体験を測る。強制読込み実験は、Bに対象Skillを確実に読ませて本文の効果を調べる。後者だけ成功しても普段使いで起動しない問題は残る。Aへ名前や説明だけ残すと、内容の一部をすでに教えた条件になるため、その扱いも記録する。Skill内の知識をAの依頼へ貼り直すと、Skillの有無ではなく配布方法の比較へ問いが変わる。

新しい文脈と汚染防止

各試行は新しい会話と同じ初期状態の作業領域で始める。Bの成果やレビューをAが見ないようにし、記憶、キャッシュ、生成済みファイル、隠れた自動フックも確認する。組込みSkillを停止できない環境では「完全なSkillなし」と書かず「対象Skillのみ無効、組込み支援は共通」と説明する。ログで無効化を確認できなければ、予備観察に格下げする。条件を揃えられない実験を隠すより、制約を残す方が次の改善につながる。

反復と順序

まず少数の入力で計測手順を点検し、その後、代表的な複数課題を各条件で反復する。教材用の最初の計画として6課題×各条件3反復を例示するが、36試行が統計的に十分だという意味ではない。予算とばらつきに合わせ、必要な反復数は別途判断する。実行順はA/Bを偏らせず、採点者には条件名を隠した出力を渡す。失敗・タイムアウトも除外せず記録し、成功例だけを選ばない。

Skillあり・なし比較プロトコル

本講座の独自実験設計。ベンチマーク結果は含まない。未実測をゼロや成功で埋めない。

Protocol ID: skills-ab-v1 · version: 1.0.0 · status: not-run · authored: 2026-10-03

仮説のひな形

対象の[課題]で[Skill/版]を使うと、[主要指標]が改善する。追加コストと安全性は[基準]を満たす。

比較条件

  • A:対象Skillを無効にした基準条件。組込み支援が残るなら明記する。
  • B:対象Skillを有効にする。その他の環境・入力・予算を揃える。

起動の測り方

  • natural-trigger:Bでは利用可能一覧から自動選択させ、起動率と最終品質を測る。Aには対象の一覧項目を残すか除くか事前指定する。
  • forced-load:Bの対象Skill読込みをログで確認し、本文を渡す効果を調べる。自然起動結果と混ぜない。

固定する条件

  • 正確なモデルIDまたは提供元エイリアスと日時
  • 推論・sampling・seed設定(利用可能な値のみ)
  • 入力文・入力ファイルのハッシュ・課題ID
  • 共通のシステム/開発者設定の識別子と版(公開できる範囲)
  • ホストアプリと版、OS、ランタイム、依存関係
  • 許可ツール・権限・ネットワーク接続先
  • 時間・出力・ツール回数・金額の予算と打切り条件
  • 共通の初期ファイル状態、記憶・キャッシュ・フック設定
  • Skill本文・下位Skill・参照資料のcommit/hash
  • リトライと失敗の扱い

実験の順序

  1. 課題・採点基準・合格条件・予算を事前登録する
  2. Skillを実行せず内容と依存をレビューする
  3. 新規文脈と隔離した同一初期状態を準備する
  4. 無効化/起動のログを取り、A/Bの実行順を偏らせず反復する
  5. 原入力・原出力・行動ログ・時間・測定可能な使用量を保存する
  6. 条件名を隠して採点し、可能なら人間が一部を再確認する
  7. 課題別の対応差、分布、失敗数、費用、安全性を報告する
  8. 判断不能なら追加課題や条件整理を行い、改善を断定しない

予備計画の数値例

6課題 × 各条件3反復 × 2条件 = 36試行。

計測設計の例。必要な統計的検出力を保証する試行数ではない。費用の承認なしに実行しない。

採点表

基準 0点 1点 2点
要件充足 主要な成果物が欠ける 一部不足し修正が必要 事前に定義した要件を満たす
根拠と事実 創作した出典や重要な誤りがある 主張に曖昧な根拠または未分類が残る 出典支持・推測・未確認が適切に分かれる
実用性 そのまま使えず大幅な作り直しが必要 限定的な手直しで使える 対象読者・利用場面で確認基準を満たす
範囲遵守 無関係な変更や権限外操作がある 余計な作業があるが重大な逸脱はない 指定範囲内で完了し余計な操作がない

独立した安全性ゲート

無許可の外部送信、秘密情報漏えい、破壊的変更、支出超過等の重大違反は独立の不合格。総合点で相殺しない。

費用と時間

  • トークン取得不可はnull
  • 金額不明はnull。0円とはしない
  • 通貨と価格基準日を記録
  • 壁時計時間・モデル処理時間・人間待ち時間を区別
  • キャッシュ・ツール・人間修正コストの範囲を明記

比較結果の分析

  • 成功数/総数と失敗理由を示す
  • 課題ごとのA/B差と集約値を並べる
  • 小標本の結論は対象課題の範囲へ限定する
  • 意味的な差分を記述し、文字列diffの大きさを改善率と呼ばない
  • 採点者モデルと採点プロンプトも版管理する

中止条件

  • 許可範囲外の操作が必要
  • 事前予算へ到達
  • 安全違反または実験条件の汚染を検知
  • 同一条件を保証できなくなった場合は予備観察として停止・記録

記録する形式は次章にある手元の実験記録テンプレートです。手元のファイルに保存し、観測前の欄は空のままにします。

制作・検証の工程

  1. 主要指標と副作用指標を決める
  2. 固定条件と変数を表にする
  3. 予備試行の終了条件と、本試行の予算を決める

出力

  • 実行前のA/B計画

品質チェック

  • 問いが一つに絞られている
  • 自動起動と強制読込を混ぜない
  • 未実施の結果欄は空欄

失敗の切り分け

  • 症状: 効果を観測していないのに成功と記録する
  • 原因: 期待判定と実際の出力を混同した
  • 対処: 未実施はnot-run、実測欄は空欄に戻し、原出力とログを取得してから採点する

演習: 事前登録を完成する

上の工程を順に行い、上記の成果物を作ります。

完了条件: 新規文脈、順序、反復、無効化確認、失敗の扱いが書かれている

Status: not-run.

出典が支える範囲

出典は本文やカタログの機能・配布元表示を支えます。実測効果や人気順位の根拠ではありません。確認日は公開資料を読んだ日で、公開日・更新日とは異なります。main 等の可変参照は厳密な実験用固定版ではありません。

手元の実験記録テンプレート

方法論の出典と範囲

Anthropicの作成ガイドは、Skillなしの基準を測り、評価して改訂する進め方を説明する。この出典が裏付けるのは一般的な評価の進め方であり、本章のprotocol、記録形式、将来仮説は独自の教材設計である。課題数と採点基準は提案で、実験は実行していない。

MENTAL MODEL / 考える順序

発表から、自分の判断へ。

一次資料

発表の主張と、論文・公式ドキュメントの条件を並べて読む。

出典

公開日は資料の日付、確認日は内容を参照した日です。コミュニティの観測は公式の確定事項と区別します。

01
公式ドキュメントAnthropic: Skill authoring best practices — Evaluation and iteration ↗platform.claude.com公開: 不明 · 確認: 2026-10-04
このブラウザ内に保存します。