型付きの答えは操作権限ではない

2026年10月2日、ggml-org は New in llama.cpp: Decision Models を公開した。呼び出し側が状態と型付きの問いを渡すと、指定した選択肢の確率を返すローカルのサーバーエンドポイント /v1/systemone を説明している。実装の経緯も追える。pull request #29818 は10月1日に作成され、10月2日にマージされて、commit a4cb4c6 になった。PR は、判断用モデルの対応を、埋め込み型モデルと GGUF の判断用メタデータの周辺に閉じた小さな実装として説明している。

これは、以前の JSON Schema のパーサー更新 とは別の、ローカル実行時の境界である。JSON Schema は生成する構文を制約する。/v1/systemone は choice、score、yes/no 型の判断とモデル確率を返す。どちらも、その判断が正しいこと、現在の事実に基づくこと、業務に合わせて確率が調整されていること、あるいは副作用を許可できることの証拠にはならない。

  1. 1観測した事実と決定的な方針
  2. 2固定した候補の選択肢
  3. 3一つの型付きの問い
  1. 1固定したローカル判断用モデル
  2. 2確率と型付きの答え
  3. 3コードがしきい値と権限を確認
  1. 1低い確信度、非対応モデル、不正なリクエスト、古い方針
  2. 2利用不可
  3. 3変更しない
順序と役割を、ひとつずつ分けて考える

モデルを使う前にサーバーの契約を読む

現在の server README は、日付付きのリリース情報ではなく運用上の契約である。問いは Clef がまとめて評価する場合を除き、それぞれ独立している。モデルとリビジョンを固定し、リクエストを受け入れる前に、そのモデルの選択肢数の上限と切り詰めの挙動を確認する。共通のエンドポイントを、交換可能な分類器として扱ってはならない。choice は最大確率の選択肢、確率分布、確信度を、score は確率で重み付けした値を、noul は真である確率を返す。output_tokens は常にゼロであり、保存された温度設定は呼び出し側のデータに対する確率の調整を保証しない。不正なリクエストは 400、判断用でないモデルまたは未対応の画像入力は 501 となる。これらは利用不可の契約状態として記録する。テキスト生成、別モデル、リモートの提供元へ黙って切り替えない。

llama.cpp のリポジトリライセンス は MIT だが、モデルの重みには及ばない。確認した公開中の OpenJev GGUF のモデルカード は、モデルカードのライセンスとして CC-BY-NC-4.0 を表示している。ページの作成時刻は公開日として扱わない。ダウンロードや配備の前に、対象カード、リビジョン、利用条件、用途を確認する。本稿のためにモデルのダウンロード、モデルライセンスの承諾、エンドポイントの起動、API 呼び出しは行っていない。

未実行の N=1 のオフライン検証例

これは独自の作業表であり、測定結果でも、ここで確認済みのサーバー手順でもない。架空のサポートチケットを一件だけ使い、モデルは呼び出さない。下流で意図する操作は、画面表示専用の確認キューへの割り当てだけである。返金、メール送信、アカウント変更、他システムの呼び出しはできない。

  1. 問いを一つに固定する。Which existing review queue fits this ticket? とし、選択肢は billing、shipping、needs_review だけにする。チケット本文、候補の説明、方針のリビジョン、選んだローカルモデルとカードのリビジョン、PR/コミットの識別子、締切を一つの記録に残す。
  2. 判断の前に、通常のコードでチケットと三つのキューが存在し、方針が現行の版であること、依頼者に四つ目の選択肢を作る権限がないことを確認する。これは判断用モデルの仕事ではなく、事実の確認である。
  3. エンドポイントを呼び出さずに、三つの検証結果を記録する。型付きの答えが許可された選択肢で、確信度が定めたしきい値を満たす pass、未知の選択肢または不正な契約の reject、しきい値未満の unknown である。unknown はこの手順では利用不可を意味し、文章生成や別のバックエンド選択を求めない。
  4. 将来、別途許可された実行では、機密でない状態のハッシュ、選ばれた選択肢、確率ベクトル、確信度、モデルとカードのリビジョン、入力トークン数、経過時間、HTTP ステータス、方針の判定だけを残す。表示専用の導入前に、取り分けた合成ケースで人のラベルと比較する。

400、501、選択肢の欠落、古い方針、タイムアウト、形式が壊れた応答、低い確信度はすべて処理を停止する。代替経路は作らない。決定的な権限確認は、モデルの判断結果の後にも残す。画面表示上の割り当てを許可できるのはコードだけであり、モデルの結果が副作用を許可することはない。

関連する Jev の基礎章 は、判断を設計する際の一般的な考え方を説明する。この更新は、日付を確認したローカル llama.cpp の契約と、コードのライセンスと重みのライセンスが別であるという境界を加える。Jev、OpenJev、Laya、Clef、ホスト型サービスの品質、費用、遅延、確率の調整、安全性を比較するものではない。発表にあるフォワードパスと典型的な用途の説明は提供元の主張であり、独立したベンチマークではない。

実際に読んだ10月2日投稿の r/LocalLLaMA のスレッド は、同じ Hugging Face 発表へリンクするコミュニティ観測である。議論では、分類と自己回帰モデルの制約、確率の調整、遅延、モデル規模が争点になっている。ハードウェアや遅延の自己申告には、比較に必要な正確なコミット、量子化、状態、テストコーパスがない。これは隔離した測定計画を作るきっかけであり、モデル順位、性能値、セキュリティ特性、リリースの事実の根拠ではない。

MENTAL MODEL / 考える順序

発表から、自分の判断へ。

一次資料

発表の主張と、論文・公式ドキュメントの条件を並べて読む。

出典

公開日は資料の日付、確認日は内容を参照した日です。コミュニティの観測は公式の確定事項と区別します。

01
New in llama.cpp: Decision Models ↗huggingface.co公開: 2026-10-02 · 確認: 2026-10-04
02
llama.cpp pull request #29818公開: 2026-10-01 · 確認: 2026-10-04
03
llama.cpp commit a4cb4c6公開: 2026-10-02 · 確認: 2026-10-04
04
llama.cpp server README公開: 不明 · 確認: 2026-10-04
05
OpenJev GGUF model card ↗huggingface.co公開: 不明 · 確認: 2026-10-04
06
llama.cpp MIT license公開: 不明 · 確認: 2026-10-04
07
r/LocalLLaMA: New in llama.cpp Decision Models (community observation) ↗www.reddit.com公開: 2026-10-02 · 確認: 2026-10-04
このブラウザ内に保存します。