AIエージェント能力アトラス › 仕事ごとの一覧 › 基盤能力(横断) › 推論・論理

常識推論・反実仮想

Commonsense and counterfactual reasoning

3/52026年: 実務品質(要確認)
2030年(予測): 4/5 専門家並み
12022
22023
32024
32025
32026
42027予
42028予
42030予

0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。

専門家と比べて

日常的な常識推論では実務品質だが、反実仮想(『もしXがなかったら』)の一貫した多段階推論は人間より脆い

できること

一般的な常識クイズ・因果推論のベンチマークで高スコアを示す

まだできないこと

長い反実仮想連鎖での一貫性維持、物理的直感を要する常識(素朴物理学)は依然弱点として報告される

なぜそうなのか

常識は訓練データに広く反映されるが、反実仮想は訓練データに直接現れにくい『仮想世界』のシミュレーションを要する

これからの予測の根拠

世界モデル研究(物理シミュレーション統合等)の進展により2028年に改善が見込まれるが根本解決は不透明

いま使える主な道具

Claude、GPT-5.x

根拠

アトラス全体の地図をひらく →

同じ分野のほかの仕事(推論・論理)

AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。