AIエージェント能力アトラス › 仕事ごとの一覧 › 基盤能力(横断) › 推論・論理
常識推論・反実仮想
Commonsense and counterfactual reasoning
3/52026年: 実務品質(要確認)
2030年(予測): 4/5 専門家並み
2030年(予測): 4/5 専門家並み
12022
22023
32024
32025
32026
42027予
42028予
42030予
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
日常的な常識推論では実務品質だが、反実仮想(『もしXがなかったら』)の一貫した多段階推論は人間より脆い
できること
一般的な常識クイズ・因果推論のベンチマークで高スコアを示す
まだできないこと
長い反実仮想連鎖での一貫性維持、物理的直感を要する常識(素朴物理学)は依然弱点として報告される
なぜそうなのか
常識は訓練データに広く反映されるが、反実仮想は訓練データに直接現れにくい『仮想世界』のシミュレーションを要する
これからの予測の根拠
世界モデル研究(物理シミュレーション統合等)の進展により2028年に改善が見込まれるが根本解決は不透明
いま使える主な道具
Claude、GPT-5.x
根拠
- Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents 2026-07
推論の失敗クラスタに反実仮想・常識推論の弱点を含む
同じ分野のほかの仕事(推論・論理)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。