AIエージェント能力アトラス › 仕事ごとの一覧 › 研究・問題解決 › 数学
数学論文の査読相当チェック(証明検証・誤り検出)
Referee-level checking of math papers (proof verification, error detection)
2030年(予測): 4/5 専門家並み
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
arXiv数百万本規模の誤り分析研究では、数学論文には人間の査読でも見逃される誤りが構造的に多数存在することが定量的に示されており、AIによる自動チェックはこの穴を部分的に埋めつつあるが、証明の「新規性」「意義」の評価は人間査読者との乖離が大きい。
できること
形式化可能な範囲の論理的ギャップ・計算ミスの検出、文献の妥当性の一次チェック、正しさ検証を含む査読レポートのドラフト作成ができる。
まだできないこと
背理法による証明のような、意図的に矛盾を導く論証ステップを誤ってペナルティ判定するなど、証明の「意図」を読み違える。引用の実在確認や論理展開の飛躍の検出、論文の学術的意義の評価は人間professional editorの確認なしには信頼できない。
なぜそうなのか
自然言語の数学的議論の意味論的理解には限界があり、統計的パターンマッチングでは「形式は正しいが意味的に間違っている」議論を見抜けないことがある。novelty(新規性)判定は査読者の分野知識・direct experienceに強く依存し、AIの訓練データには反映されにくい。
これからの予測の根拠
形式化技術(Lean等)との統合が進めば論理的誤りの検出精度は着実に上がると見て2028年に専門家並みへ。ただし「意義評価」は本質的に人間的判断であり続けるため、伸びは緩やか。
いま使える主な道具
GPT-5.x、Claude Fable 5.1、specialized Lean-based verifiers
根拠
- From Euler to Today: Universal Mathematical Fallibility - A Large-Scale Computational Analysis of Errors in ArXiv Papers 2025-2026
数学論文に構造的に存在する誤りの規模を定量化 - Auditing an AI-Generated Mathematical Proof: Human Assessment of OpenAI's Quantum Parallel-Repetition Argument 2026
AI生成証明を人間が監査した詳細事例、証明ステップの誤判定を含む限界を報告 - Terence Tao on AI — a living summary 2026
AIによる証明検証・査読支援に関するTaoの継続更新見解
同じ分野のほかの仕事(数学)
- 競技数学(IMO/Putnam級)
- 競技プログラミング(ICPC/IOI級アルゴリズム設計)
- 定理証明・形式化(Lean/Isabelle)
- 未解決問題への貢献(Erdős問題・主要予想)
- 大規模計算実験・構成的探索(AlphaEvolve/FunSearch型)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。