AIエージェント能力アトラス › 仕事ごとの一覧 › 基盤能力(横断) › 推論・論理
数理・論理パズルの解決
Mathematical and logical reasoning
4/52026年: 専門家並み
2030年(予測): 5/5 専門家超え
2030年(予測): 5/5 専門家超え
12022
22023
32024
42025
42026
42027予
52028予
52030予
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
国際数学オリンピック級の問題を解く推論モデルはトップクラスの人間に匹敵する場面がある一方、実務的な応用数理(未整形の問題設定)は別
できること
形式化された数学・論理パズル(IMO級含む)で高い正答率。コード実行と組み合わせた検算も可能
まだできないこと
現実の曖昧な問題を数理モデルに落とし込む定式化能力(モデリング)は人間の専門家に劣る
なぜそうなのか
推論モデル(thinking mode)は形式的探索空間の広い問題に強い一方、問題設定自体の曖昧性解消は別の能力
これからの予測の根拠
形式的推論は既に高水準のため、2028年までの伸びは主に応用数理・モデリング能力側で見込まれる
いま使える主な道具
Claude thinking、o系、Gemini 3.1 Deep Think
根拠
- Prompting Reasoning Models in 2026: GPT-5.5, Claude, Gemini, and DeepSeek 2026
2026年時点の主要推論モデルの強み・弱みを比較
同じ分野のほかの仕事(推論・論理)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。