長く考えれば賢い、は運用では破綻する

推論モデルは、難問でより多くのtokenを使うことで精度を伸ばせることがある。しかし利用者にとってtokenは待ち時間と費用であり、無限に使える資源ではない。2025年の四論文は、同じ問題を異なる場所で扱う。推論時計算を難度へ配る、学習時のRLを速くする、短い推論を制御する、長さへの報酬を動的にする。このノートは著者の結果を一般化せず、実装で検証する仮説として整理する。

  1. 1難易度の異なる問題
  2. 2推論token配分
  3. 3正答率と費用
  1. 1学習時のRL設計
  2. 2sample/更新効率
  3. 3学習時間と安定性
  1. 1本番
  2. 2予算・停止・検査
  3. 3利用者の受け入れ基準
順序と役割を、ひとつずつ分けて考える

1. 計算を一律に配らない:Training Language Models to Reason Efficiently

Training Language Models to Reason Efficientlyは2025-02-06公開のarXiv論文で、RLにより問題の複雑さに応じて推論時計算を動的に割り当てることを狙う。abstractが述べる中心は、一つのhyperparameterで効率レベルの異なる推論モデル群を導けるという点である。何が変わったかは、常に同じ長さを考えるモデルではなく、難しい問題へ多くの計算を割く方針を学ばせることにある。

これは「短く答えさせれば安い」という素朴な対策より強い。短すぎる停止は難問を壊し、長すぎる推論は易問で無駄になるからだ。一方で、難度を誤って推定すれば、必要な時に予算を切る。論文の評価条件、対象モデル、報酬、ベンチマークを自分の日本語業務へそのまま移さない。実装演習では、質問を易・中・難に人手で分け、固定最大tokenと二段階のbudgetを比較する。正答、引用の有無、p95待ち時間、平均出力tokenを同じ表に置く。

2. 小型モデルの推論を短くする:Making Small Language Models Efficient Reasoners

Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcementは2025-05-12公開で、長いchain-of-thoughtが小型モデルにもたらす推論改善と、冗長なtraceによる効率悪化を扱う。著者はthinking phaseの停止点を制御するTemperature Scalingと、GRPOに基づく長さ正則化RLであるTLDRを提案する。abstractでは複数の数学ベンチマークで、TLDRがSFT baselineと比べ、精度を大きく落とさずtoken効率を約50%改善したと報告する。この数値は著者の評価条件であり、本ノートでは独立再現していない。

重要なのは、出力を切る対象が「思考が長いこと」ではなく、問題に寄与しないtokenであるという狙いだ。ただし、可視の思考過程を短くすることが正しさや安全性の説明可能性を直接高めるとは限らない。製品側では、内部推論を利用者へ表示する必要性、最終回答の根拠引用、失敗時に再試行する予算を別に設計する。実習は同一問題で最大出力を段階的に減らし、正答だけでなく途中でJSON schemaを壊す率、引用抜け、停止理由を測る。

3. RL実装のボトルネックを測る:Effective Reinforcement Learning for Reasoning in Language Models

Effective Reinforcement Learning for Reasoning in Language Modelsは2025-05-22公開で、LM推論向けRLの精度と計算効率に関する設計選択を分析する。abstractではon-policy RL、PPO由来のoff-policy update、KL除去の観察に加え、推論とbackpropagationで最適batch sizeが異なることを効率のボトルネックとして挙げる。著者は大きなbatchを先取りsampleし小さな更新へ分けるpreemptive samplingと、小さいadvantageのsampleを落とすgradient filteringを含むDASHを提案し、標準的GRPO実装比で精度を失わず学習時間を83%短縮したと報告する。これは小型モデルを中心にした著者条件の結果である。

ここから持ち帰るべきは「RLを使う」ではなく、GPUがどこで待っているかを分けて測る姿勢だ。rollout、reward計算、gradient、通信、checkpointの時間を一つの学習速度に混ぜない。advantageが小さいsampleを落とせば速くなる可能性があるが、希少な難例を捨てて分布を変える危険もある。実習ではまず学習を変えず、各段階のwall time、token数、GPU利用、loss、task scoreをログへ出す。提案法の再実装は、著者コードとライセンスを別途確認してから小さな設定で行う。

4. 長さ報酬を固定しない:Bingo

Bingo: Boosting Efficient Reasoning of LLMs via Dynamic and Significance-based Reinforcement Learningは2025-06-09公開で、冗長な推論を減らすことを狙う。abstractによれば、significance-aware length rewardは重要でないtokenを主に減らすよう導き、dynamic length rewardは難問での十分な推論を最初は促しつつ時間とともに減衰させる。短くする圧力を固定すれば、モデルは最初から早く答え過ぎるかもしれない。そのため学習の段階と問題の意味を報酬へ入れる。

トレードオフは「重要でない」を誰が定義するかにある。数学の正解判定が使える環境と、要約、対話、コード修正のように正解が一つでない環境では報酬設計が違う。長さを減らしても、根拠を省いたり、重要な例外を消したりすれば品質は落ちる。実習では、人手で重要な根拠句をmarkした小セットを作り、短縮前後で必須句の保持率、誤った断定、token数を比較する。自動judgeだけで重要性を決めない。

実装へ持ち込む共通の実験

  1. 成功を「ベンチマーク得点」だけでなく、タスク正答、根拠、構造化出力、待ち時間、費用、拒否すべき時の挙動で定義する。
  2. まず推論時のbudgetを変える。RL学習はデータ、計算、報酬、検証の面積が大きいので、出力上限・段階的再試行・問題分類で観測できる範囲を先に試す。
  3. 難問を長く考えさせる時も、最大予算、timeout、利用者への進行表示、途中取消を設ける。遅い正答が常に良い体験ではない。
  4. 一つの改善が別の失敗を増やしていないか、固定の失敗セットで確かめる。短縮率だけを改善指標にしない。

この四論文は、推論を増やす競争から、どこへ計算を置くかという設計へ視線を移す。だが配分の正しさは自分の利用者とデータでしか決まらない。論文の数値は出発点であり、採用の署名ではない。

単発のaccuracyではなくbudget frontierを使う

各workloadで少なくとも三つのreasoning budgetをsweepし、verified-task pass rateをwall-clock latency、generated token、verifier costに対して描く。prompt、model revision、temperature、tool availability、stopping ruleを固定する。そうしないと見かけの効率改善がsampling変更や弱いverification workloadに過ぎないことがある。

local reasoning hardwareについての2026年Reddit discussionはcommunity observationでありbenchmarkではない。自分のmachineで実際のtokens per secondとmemoryを記録する契機にはなるが、手法がmodel間で転移する証拠にはならない。

Quiet-STaR(2024)はlatent rationaleの生成costを明示した。その結果はhidden traceを露出する理由ではなく、追加reasoningをどうbudgetし評価するかという2025年の問いの前史である。固定したanswer-only baselineと上限付きreasoning条件を比べ、長い計算を進歩とみなさずtask correctnessとcostの両方を採点する。

2026年9月のPTTS論文は、固定executorのbranchの前に協調したoutlineを置き、独立sampleが同じreasoning modeを繰り返し得ることを扱う。報告されたbenchmark gainは著者の結果であり、本章の結果ではない。移せる実験は小さい。branch budgetを決め、提案outlineを手法でlabelし、ほぼ同一のoutlineをdeduplicateし、独立samplingとsolved-task rate、総token、反復failure modeを比べる。

MENTAL MODEL / 考える順序

発表から、自分の判断へ。

一次資料

発表の主張と、論文・公式ドキュメントの条件を並べて読む。

出典

01
Training Language Models to Reason Efficiently ↗arxiv.org · 2025-02-06
02
Making Small Language Models Efficient Reasoners ↗arxiv.org · 2025-05-12
03
Effective Reinforcement Learning for Reasoning in Language Models ↗arxiv.org · 2025-05-22
04
Bingo: Boosting Efficient Reasoning of LLMs ↗arxiv.org · 2025-06-09
05
Reddit LocalLLaMA discussion: local reasoning hardware ↗www.reddit.com · unknown
06
Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking ↗arxiv.org · 2024-03-14
07
Planned Test-Time Scaling with Coordinated Reasoning Paths ↗arxiv.org · 2026-09-23

自分のノート