評価する単位は、設定を固定した実行系である

Agents Are Systems, Not Models は 2026-10-01 12:55:07 UTC(日本時間21:55:07)に arXiv v1 として投稿された。論文はエージェントを、モデルだけでなく、文脈、ツール、時間、結果のフィードバックを与える実行基盤まで含むものとして扱う。この見方では「モデル X は解けたか」だけでは問いが小さすぎる。与えた作業情報、指示文、ツールの入出力契約、停止規則、検証器が判断できる範囲も変わっていれば、何が成績の差を生んだのか分からない。

著者らは四つの科学ワークフローで、実際に解こうとした実行の結果のばらつきの約54% が、設定軸の変更ではなく、同じ設定をもう一度実行することから生じたと報告する。これはその課題群と実行基盤における著者らの結果であり、あらゆるエージェント、モデル、コーディング課題に通用するばらつきの割合ではない。移せる教訓は限定的である。見かけの成績差をモデルや指示文の功績にする前に、設定を固定した実行を繰り返す。

2024年7月の AI Agents That Matter の要旨は、正確さ、費用、下流の利用要件、再現可能性を分けて考える必要をすでに論じていた。この資料は、今回の反復実行によるばらつきの結果を証明するものではない。ここでの狭い前史は、指定した条件で再現できないエージェントの結果は、正確さだけでは実行系の選定を導けない、という問いである。

  1. 1作業契約
  2. 2固定した設定の記録票
  3. 3オフラインでの反復実行
  1. 1各実行
  2. 2完了状態、検証結果、時間、費用、ツールエラー
  1. 1同じ設定
  2. 2ばらつきと失敗分類
  3. 3維持、一軸だけ変更、または停止
  1. 1検証器の権限範囲
  2. 2明示した根拠の範囲
  3. 3確認表の外の操作を許可しない
順序と役割を、ひとつずつ分けて考える

論文は、与える情報、推論、指示文で求める自己検証、時間予算、基盤モデルを比較する。また、その条件では、検証を求めるだけよりも専用の検証ツールを与える方が検証行動を変えたと報告する。これは、すべてのツールが信頼できるという意味ではない。検証器は不完全、古い、過度に通す、あるいは練習用の課題にしか判断権限がないかもしれない。

未実行の N=1 オフライン反復確認表

以下はこの教材固有の、未実行のオフライン確認表である。提供元の API を呼ばず、実行環境を導入せず、ベンチマークを走らせず、非公開ファイルに触れず、外部操作を行わない。ローカルのスキーマと二つの算術整合性検査を満たす JSON を作る、といった決定的な検査器付きの架空課題を一つ選ぶ。

最初の実行より前に、一つの設定記録票を書く。

記録項目 一つの具体的な値に固定する
課題と入力 架空課題の ID と不変の入力ファイルのハッシュ
実行系 モデル識別子、実行基盤の版、指示文の版、ツール一覧
設定軸 推論モード、最大ステップ数・時間・トークン数、渡す文脈、可能なら温度設定と乱数シード
検証器 検査器の版、正確な条件、判定できないケース、判断権限の範囲
計測 開始・終了時刻、公開されるトークン数・リクエスト数、実時間、ローカル費用推定の方法

同じ設定記録票で、オフライン実行を最大三回だけ行う。各回で生の出力、検証結果、停止理由、ツール呼び出しとエラーの件数、実時間、得られる費用の分母を残す。構文解析エラー、タイムアウト、拒否、検査器の例外を平均の中に消さない。アカウントや実行環境が費用やトークンの分母を示さない場合は unknown と書く。他のモデルや価格ページから作らない。

反復結果を残した後にだけ、一つの設定軸を変えられる。例えば課題、モデルの版、指示文、予算を変えずに、JSON の形を検査するローカルの検査器を加える。検査器が答えられるのは、この確認表の条件を満たすかだけである。配備、メッセージ送信、クラウド資源の変更、別アカウントのデータ利用、架空の入力の外でも課題が正しいという主張は許可できない。

成績を調整する前に、ばらつきを読む

最良の一回から結論を作らず、小さな表を使う。

結果の型 残す診断 次の安全な手順
全実行が同じ条件を満たさない 与えた作業情報、能力、検査器のどれかが誤っている可能性 契約を読む。自動で予算を増やさない
同じ記録票で結果が異なる 確率的な揺れ、または隠れた状態の可能性 全実行記録を残し、状態や版の混入を調べる
検査器は合格、人の規則では不合格 検査器の判断権限に穴がある 公開判定にせず、主張を狭める
時間や費用が欠ける 計測の境界がない unknown を残し、効率を比較しない

論文の公開リポジトリは10月4日に読めたが、ルートには README と .gitignore だけがあり、API メタデータはライセンスなしと示した。論文が報告するベンチマークと実行履歴の公開は調べる入口であって、現時点で実行可能かつライセンスが確定した再現実装の証拠ではない。論文自身も、結論を二つの科学領域の四課題に限定し、記憶と複数エージェントの連携を変数に入れていない。

この確認表は既存の論文の読み方を実装へつなぐ手順を補う。論文の成績がローカルの仮説になるのは、作業契約、実行系の版、反復回数、検証器の判断範囲、欠けた分母が見えるときだけである。架空課題の一行が成功しても、それはその一行の根拠であり、本番操作を許可する権限にはならない。

MENTAL MODEL / 考える順序

発表から、自分の判断へ。

一次資料

発表の主張と、論文・公式ドキュメントの条件を並べて読む。

出典

公開日は資料の日付、確認日は内容を参照した日です。コミュニティの観測は公式の確定事項と区別します。

01
Agents Are Systems, Not Models: Rethinking Agentic Evaluation ↗arxiv.org公開: 2026-10-01 · 確認: 2026-10-04
02
Rethinking agent evaluation repository公開: 不明 · 確認: 2026-10-04
03
AI Agents That Matter ↗arxiv.org公開: 2024-07-01 · 確認: 2026-10-04
このブラウザ内に保存します。