AIエージェント能力アトラス › 仕事ごとの一覧 › 基盤能力(横断) › 推論・論理
推論の強さと計画能力のギャップ
The reasoning-vs-planning gap
3/52026年: 実務品質(要確認)
2030年(予測): 4/5 専門家並み
2030年(予測): 4/5 専門家並み
02022
12023
22024
22025
32026
32027予
42028予
42030予
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
熟練者は経験的に『先を読んで今の一手を決める』が、推論モデルはCoTによる局所最適選択に留まりやすい
できること
各ステップの局所的な妥当性評価(このアクションは合理的か)は実務品質
まだできないこと
長期的帰結を踏まえて早期の決定を後から見直す(バックトラック的な再構成)は弱く、『推論の強さ』と『計画の強さ』は相関しないという実証結果がある
なぜそうなのか
標準的なCoTは逐次的貪欲方策であり、探索木のバックトラックのような真の計画アルゴリズムとは構造が異なる
これからの予測の根拠
階層的・制約考慮型プランニング手法の実用化により2028年ごろギャップ縮小が見込まれる
いま使える主な道具
Claude thinking、階層的プランナー研究
根拠
- Why Reasoning Fails to Plan: A Planning-Centric Analysis of Long-Horizon Decision Making in LLM Agents 2026-01
推論モデルの強さが長期計画性能を保証しないことを実証
同じ分野のほかの仕事(推論・論理)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。