比較条件、失敗した例、採点の理由を記録する。
学習時間の目安: 60 分.
- 1原入力と原出力
- 2実測値またはnull
- 3採点理由
- 4公開用に編集した記録
独自の学習図。矢印は読み進める順序や判断の流れを表し、実測した実行traceではない。
前提となる章
根拠と演習の状態
本章は編集された学習ガイドです。出典を読んだこととSkillを実行して効果を測ったことを分けます。演習は未実施:not-run。実験ログやモデル出力はありません。
学習目標
- 質・時間・コスト・安全性を別々に残せる
- 小標本や欠測を隠さず結果を読める
仕事の役割
- 学習者:仮説と採点基準を決める
- AI:承認された範囲の読取りと成果物作成を補助する
- レビュー担当:成果とログを分けて確認する
入力
- この章で指定した入力例
- 確認する公式資料と版
一つの総合点へ急がない
採点は、要件充足、根拠の正確さ、使いやすさ、不要な変更、権限遵守などに分ける。各項目0〜2点なら、0は欠落や誤り、1は一部満たすが手直しが必要、2は指定した基準を満たす、と具体的なアンカーを用意する。文章量の多さや専門語の数は品質そのものではない。コードはテストだけでなく差分を読み、教材は出典と読者の理解を確認する。安全上の重大違反は合計点で相殺しない。
コストと時間は測れたものだけ
入出力トークン、キャッシュ扱い、ツール料金が取得できる場合は別々に保存する。購読サービスで1試行ごとの料金が分からないならnullとし、勝手に0円へ置き換えない。開始から成果物までの壁時計時間と、モデル処理時間や人間の確認待ち時間は違う。何を含めたかを書けば、長くても手戻りが少ない運用と、短いが後で修正が必要な運用を比較できる。人間の修正時間も可能なら別に計測する。
出力差分を四つの観点で読む
第一に内容の追加・欠落、第二に事実の訂正・新しい誤り、第三に構造と実用性、第四に行動の違いを見る。文字列のdiffは文章の並び替えでも大きくなるため、その大きさを改善率と呼ばない。差分コメントは「Bには出典不足を示す欄があり、Aにはない」のように観測を書き、その後で「Skillの手順が寄与した可能性」を解釈として分ける。実験設計で隔離できていない原因を断定しない。
平均と失敗例を一緒に残す
各課題のA/Bの対応差を見てから、平均・中央値・ばらつき・成功数/総数を示す。小さな試行数なら、そのままnを表示し、広い用途へ一般化しない。統計的な区間推定を使う場合は方法と前提を残す。採点を別のモデルへ任せるなら、採点モデル、プロンプト、匿名化、順序、再採点の有無も記録する。モデル採点の結果を人間の絶対的評価と同一視しない。
公開用と保管用を分ける
保管用の台帳には入力、原出力、採点理由、ログ、モデルとSkillの版を対応づける。公開用には個人情報や秘密を除き、公開できる成果物だけを載せる。元ログを変更せず、編集済みの公開版を別に作る。未実施はnot-run、途中はrunning、失敗はfailed、完了はcompletedと分ける。「予定」と「結果」が同じ画面にあっても、ラベルと空欄によって読者が取り違えないことが大切だ。
完全な未実施レコードのひな形
これは保存形式の例であり、実験結果ではありません。null は不明または未取得を表し、0や成功へ置き換えません。状態は not-run のままです。
| 欄 | 保存するもの |
|---|---|
task |
課題ID、原入力、入力ファイル、ハッシュ |
model |
提供元、正確なモデルID、snapshot、aliasの有無、設定と取得不能な設定 |
runtime |
クライアント・版・OS、ツール・権限・予算、文脈・初期状態・無効条件の隔離、組込みSkill、キャッシュ |
skill |
有効状態、repo・path・commit・hash、宣言版、起動と証拠、参照資料・下位Skill・hook |
output |
原文、成果物ファイル、ログ参照、出力ハッシュ |
metrics |
入出力・キャッシュトークン、ツール数、壁時計・モデル・人間待ち・手直し時間、料金・通貨・価格基準日 |
evaluation |
匿名条件ラベル、採点者、採点モデル、採点表の版、点数、安全違反、根拠 |
comparison |
対応するrun、観測差、解釈、不確実性 |
failure |
失敗情報。未実施ではnull |
publication |
秘匿処理の必要性、公開用の編集済み出力、公開可否 |
{
"schemaVersion": "1.0.0",
"experimentId": "skills-ab-example-not-run",
"runId": null,
"status": "not-run",
"plannedAt": "2026-10-03",
"startedAt": null,
"endedAt": null,
"condition": null,
"mode": null,
"task": {
"id": null,
"prompt": null,
"inputFiles": [],
"inputHash": null
},
"model": {
"provider": null,
"modelId": null,
"snapshotId": null,
"isAlias": null,
"settings": {},
"settingsUnavailable": []
},
"runtime": {
"client": null,
"version": null,
"os": null,
"tools": [],
"permissions": [],
"budget": {},
"freshContextVerified": false,
"sharedInitialStateHash": null,
"baselineIsolationVerified": false,
"knownBuiltInSkills": [],
"cacheNotes": null
},
"skill": {
"enabled": null,
"repositoryUrl": null,
"path": null,
"commit": null,
"contentHash": null,
"declaredVersion": null,
"activationObserved": null,
"activationEvidence": null,
"loadedResources": [],
"nestedSkills": [],
"hooks": []
},
"output": {
"rawText": null,
"files": [],
"transcriptRef": null,
"outputHash": null
},
"metrics": {
"inputTokens": null,
"outputTokens": null,
"cachedTokens": null,
"toolCalls": null,
"wallClockMs": null,
"modelMs": null,
"humanWaitMs": null,
"humanReworkMs": null,
"cost": null,
"currency": null,
"priceDate": null,
"measurementNotes": null
},
"evaluation": {
"blindedLabel": null,
"graderType": null,
"graderModel": null,
"rubricVersion": null,
"scores": [],
"safetyViolations": [],
"evidence": []
},
"comparison": {
"pairedRunId": null,
"observedDifferences": [],
"interpretation": null,
"uncertainties": []
},
"failure": null,
"publication": {
"redactionRequired": true,
"sanitizedOutputRef": null,
"allowedToPublish": false
}
}実施済み実験の件数
原稿の experiments は空の配列 [] です。実施済みの比較実験は0件で、モデル出力・時間・トークン・料金・効果の記録はありません。上記の空欄はそのまま保ちます。演習を計画しただけでは測定済みになりません。
制作・検証の工程
- 付属テンプレートへモデル・Skill・入力の識別欄を用意する
- 課題ごとの採点基準を具体化する
- 未実施レコードを保存し、結果と誤認されないか読み直す
出力
- 実験台帳テンプレートと採点表
品質チェック
- 入力と原出力が対になる
- 観測と解釈が分かれている
- 安全違反を総合点で隠さない
失敗の切り分け
- 症状: 効果を観測していないのに成功と記録する
- 原因: 期待判定と実際の出力を混同した
- 対処: 未実施はnot-run、実測欄は空欄に戻し、原出力とログを取得してから採点する
演習: 空の台帳を埋めずに準備する
上の工程を順に行い、上記の成果物を作ります。
完了条件: 測れない値はnull、出力未取得は空で、架空の成績が入っていない
Status: not-run.
出典が支える範囲
出典は本文やカタログの機能・配布元表示を支えます。実測効果や人気順位の根拠ではありません。確認日は公開資料を読んだ日で、公開日・更新日とは異なります。main 等の可変参照は厳密な実験用固定版ではありません。
方法論の出典と範囲
Anthropicの作成ガイドは、Skillなしの基準を測り、評価して改訂する進め方を説明する。この出典が裏付けるのは一般的な評価の進め方であり、本章のprotocol、記録形式、将来仮説は独自の教材設計である。課題数と採点基準は提案で、実験は実行していない。
手元の実験台帳を使う
ブラウザー内の実験台帳を開く。まず計画を記録し、不明な値は空欄にする。実行済みとして保存するには出力の証拠が必要。この台帳はモデルを実行せず、記録をアップロードしない。上の記録表を別の文書として使ってもよい。
MENTAL MODEL / 考える順序
発表から、自分の判断へ。
発表の主張と、論文・公式ドキュメントの条件を並べて読む。
出典
公開日は資料の日付、確認日は内容を参照した日です。コミュニティの観測は公式の確定事項と区別します。
01