比較条件、失敗した例、採点の理由を記録する。

学習時間の目安: 60 分.

  1. 1原入力と原出力
  2. 2実測値またはnull
  3. 3採点理由
  4. 4公開用に編集した記録
順序と役割を、ひとつずつ分けて考える

独自の学習図。矢印は読み進める順序や判断の流れを表し、実測した実行traceではない。

前提となる章

根拠と演習の状態

本章は編集された学習ガイドです。出典を読んだこととSkillを実行して効果を測ったことを分けます。演習は未実施:not-run。実験ログやモデル出力はありません。

学習目標

  • 質・時間・コスト・安全性を別々に残せる
  • 小標本や欠測を隠さず結果を読める

仕事の役割

  • 学習者:仮説と採点基準を決める
  • AI:承認された範囲の読取りと成果物作成を補助する
  • レビュー担当:成果とログを分けて確認する

入力

  • この章で指定した入力例
  • 確認する公式資料と版

一つの総合点へ急がない

採点は、要件充足、根拠の正確さ、使いやすさ、不要な変更、権限遵守などに分ける。各項目0〜2点なら、0は欠落や誤り、1は一部満たすが手直しが必要、2は指定した基準を満たす、と具体的なアンカーを用意する。文章量の多さや専門語の数は品質そのものではない。コードはテストだけでなく差分を読み、教材は出典と読者の理解を確認する。安全上の重大違反は合計点で相殺しない。

コストと時間は測れたものだけ

入出力トークン、キャッシュ扱い、ツール料金が取得できる場合は別々に保存する。購読サービスで1試行ごとの料金が分からないならnullとし、勝手に0円へ置き換えない。開始から成果物までの壁時計時間と、モデル処理時間や人間の確認待ち時間は違う。何を含めたかを書けば、長くても手戻りが少ない運用と、短いが後で修正が必要な運用を比較できる。人間の修正時間も可能なら別に計測する。

出力差分を四つの観点で読む

第一に内容の追加・欠落、第二に事実の訂正・新しい誤り、第三に構造と実用性、第四に行動の違いを見る。文字列のdiffは文章の並び替えでも大きくなるため、その大きさを改善率と呼ばない。差分コメントは「Bには出典不足を示す欄があり、Aにはない」のように観測を書き、その後で「Skillの手順が寄与した可能性」を解釈として分ける。実験設計で隔離できていない原因を断定しない。

平均と失敗例を一緒に残す

各課題のA/Bの対応差を見てから、平均・中央値・ばらつき・成功数/総数を示す。小さな試行数なら、そのままnを表示し、広い用途へ一般化しない。統計的な区間推定を使う場合は方法と前提を残す。採点を別のモデルへ任せるなら、採点モデル、プロンプト、匿名化、順序、再採点の有無も記録する。モデル採点の結果を人間の絶対的評価と同一視しない。

公開用と保管用を分ける

保管用の台帳には入力、原出力、採点理由、ログ、モデルとSkillの版を対応づける。公開用には個人情報や秘密を除き、公開できる成果物だけを載せる。元ログを変更せず、編集済みの公開版を別に作る。未実施はnot-run、途中はrunning、失敗はfailed、完了はcompletedと分ける。「予定」と「結果」が同じ画面にあっても、ラベルと空欄によって読者が取り違えないことが大切だ。

完全な未実施レコードのひな形

これは保存形式の例であり、実験結果ではありません。null は不明または未取得を表し、0や成功へ置き換えません。状態は not-run のままです。

欄 保存するもの
task 課題ID、原入力、入力ファイル、ハッシュ
model 提供元、正確なモデルID、snapshot、aliasの有無、設定と取得不能な設定
runtime クライアント・版・OS、ツール・権限・予算、文脈・初期状態・無効条件の隔離、組込みSkill、キャッシュ
skill 有効状態、repo・path・commit・hash、宣言版、起動と証拠、参照資料・下位Skill・hook
output 原文、成果物ファイル、ログ参照、出力ハッシュ
metrics 入出力・キャッシュトークン、ツール数、壁時計・モデル・人間待ち・手直し時間、料金・通貨・価格基準日
evaluation 匿名条件ラベル、採点者、採点モデル、採点表の版、点数、安全違反、根拠
comparison 対応するrun、観測差、解釈、不確実性
failure 失敗情報。未実施ではnull
publication 秘匿処理の必要性、公開用の編集済み出力、公開可否
{
  "schemaVersion": "1.0.0",
  "experimentId": "skills-ab-example-not-run",
  "runId": null,
  "status": "not-run",
  "plannedAt": "2026-10-03",
  "startedAt": null,
  "endedAt": null,
  "condition": null,
  "mode": null,
  "task": {
    "id": null,
    "prompt": null,
    "inputFiles": [],
    "inputHash": null
  },
  "model": {
    "provider": null,
    "modelId": null,
    "snapshotId": null,
    "isAlias": null,
    "settings": {},
    "settingsUnavailable": []
  },
  "runtime": {
    "client": null,
    "version": null,
    "os": null,
    "tools": [],
    "permissions": [],
    "budget": {},
    "freshContextVerified": false,
    "sharedInitialStateHash": null,
    "baselineIsolationVerified": false,
    "knownBuiltInSkills": [],
    "cacheNotes": null
  },
  "skill": {
    "enabled": null,
    "repositoryUrl": null,
    "path": null,
    "commit": null,
    "contentHash": null,
    "declaredVersion": null,
    "activationObserved": null,
    "activationEvidence": null,
    "loadedResources": [],
    "nestedSkills": [],
    "hooks": []
  },
  "output": {
    "rawText": null,
    "files": [],
    "transcriptRef": null,
    "outputHash": null
  },
  "metrics": {
    "inputTokens": null,
    "outputTokens": null,
    "cachedTokens": null,
    "toolCalls": null,
    "wallClockMs": null,
    "modelMs": null,
    "humanWaitMs": null,
    "humanReworkMs": null,
    "cost": null,
    "currency": null,
    "priceDate": null,
    "measurementNotes": null
  },
  "evaluation": {
    "blindedLabel": null,
    "graderType": null,
    "graderModel": null,
    "rubricVersion": null,
    "scores": [],
    "safetyViolations": [],
    "evidence": []
  },
  "comparison": {
    "pairedRunId": null,
    "observedDifferences": [],
    "interpretation": null,
    "uncertainties": []
  },
  "failure": null,
  "publication": {
    "redactionRequired": true,
    "sanitizedOutputRef": null,
    "allowedToPublish": false
  }
}

実施済み実験の件数

原稿の experiments は空の配列 [] です。実施済みの比較実験は0件で、モデル出力・時間・トークン・料金・効果の記録はありません。上記の空欄はそのまま保ちます。演習を計画しただけでは測定済みになりません。

手元の実験記録テンプレート

制作・検証の工程

  1. 付属テンプレートへモデル・Skill・入力の識別欄を用意する
  2. 課題ごとの採点基準を具体化する
  3. 未実施レコードを保存し、結果と誤認されないか読み直す

出力

  • 実験台帳テンプレートと採点表

品質チェック

  • 入力と原出力が対になる
  • 観測と解釈が分かれている
  • 安全違反を総合点で隠さない

失敗の切り分け

  • 症状: 効果を観測していないのに成功と記録する
  • 原因: 期待判定と実際の出力を混同した
  • 対処: 未実施はnot-run、実測欄は空欄に戻し、原出力とログを取得してから採点する

演習: 空の台帳を埋めずに準備する

上の工程を順に行い、上記の成果物を作ります。

完了条件: 測れない値はnull、出力未取得は空で、架空の成績が入っていない

Status: not-run.

出典が支える範囲

出典は本文やカタログの機能・配布元表示を支えます。実測効果や人気順位の根拠ではありません。確認日は公開資料を読んだ日で、公開日・更新日とは異なります。main 等の可変参照は厳密な実験用固定版ではありません。

手元の実験記録テンプレート

方法論の出典と範囲

Anthropicの作成ガイドは、Skillなしの基準を測り、評価して改訂する進め方を説明する。この出典が裏付けるのは一般的な評価の進め方であり、本章のprotocol、記録形式、将来仮説は独自の教材設計である。課題数と採点基準は提案で、実験は実行していない。

手元の実験台帳を使う

ブラウザー内の実験台帳を開く。まず計画を記録し、不明な値は空欄にする。実行済みとして保存するには出力の証拠が必要。この台帳はモデルを実行せず、記録をアップロードしない。上の記録表を別の文書として使ってもよい。

MENTAL MODEL / 考える順序

発表から、自分の判断へ。

一次資料

発表の主張と、論文・公式ドキュメントの条件を並べて読む。

出典

公開日は資料の日付、確認日は内容を参照した日です。コミュニティの観測は公式の確定事項と区別します。

01
公式ドキュメントAnthropic: Skill authoring best practices — Evaluation and iteration ↗platform.claude.com公開: 不明 · 確認: 2026-10-04
このブラウザ内に保存します。