AIエージェント能力アトラス › 仕事ごとの一覧 › 研究・問題解決 › 数学

数学論文の査読相当チェック(証明検証・誤り検出)

Referee-level checking of math papers (proof verification, error detection)

3/52026年: 実務品質(要確認)
2030年(予測): 4/5 専門家並み
02022
12023
22024
22025
32026
32027予
42028予
42030予

0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。

専門家と比べて

arXiv数百万本規模の誤り分析研究では、数学論文には人間の査読でも見逃される誤りが構造的に多数存在することが定量的に示されており、AIによる自動チェックはこの穴を部分的に埋めつつあるが、証明の「新規性」「意義」の評価は人間査読者との乖離が大きい。

できること

形式化可能な範囲の論理的ギャップ・計算ミスの検出、文献の妥当性の一次チェック、正しさ検証を含む査読レポートのドラフト作成ができる。

まだできないこと

背理法による証明のような、意図的に矛盾を導く論証ステップを誤ってペナルティ判定するなど、証明の「意図」を読み違える。引用の実在確認や論理展開の飛躍の検出、論文の学術的意義の評価は人間professional editorの確認なしには信頼できない。

なぜそうなのか

自然言語の数学的議論の意味論的理解には限界があり、統計的パターンマッチングでは「形式は正しいが意味的に間違っている」議論を見抜けないことがある。novelty(新規性)判定は査読者の分野知識・direct experienceに強く依存し、AIの訓練データには反映されにくい。

これからの予測の根拠

形式化技術(Lean等)との統合が進めば論理的誤りの検出精度は着実に上がると見て2028年に専門家並みへ。ただし「意義評価」は本質的に人間的判断であり続けるため、伸びは緩やか。

いま使える主な道具

GPT-5.x、Claude Fable 5.1、specialized Lean-based verifiers

根拠

アトラス全体の地図をひらく →

同じ分野のほかの仕事(数学)

AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。