AIエージェント能力アトラス › 仕事ごとの一覧 › 研究・問題解決 › 数学
大規模計算実験・構成的探索(AlphaEvolve/FunSearch型)
Large-scale computational search / constructive optimization (AlphaEvolve/FunSearch)
2030年(予測): 5/5 専門家超え
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
AlphaEvolveは56年間破られなかった行列乗算アルゴリズムの記録を更新し、人手で提示された未解決問題の約20%で新たな最適解を発見。cap-set問題の下界更新(FunSearch)、次元11でのkissing number境界、Erdősの最小重複予想などで人間専門家の記録を更新した。
できること
人間が定義した評価関数(evaluator)付きの最適化・構成問題に対し、大量の候補プログラムを進化的に生成・評価し、人間には現実的な時間で到達できない規模の探索によって新しい構成・反例を発見できる。
まだできないこと
評価関数(何が「良い解」かを判定するプログラム)は依然として人間が設計する必要があり、問題設定そのものの自動化はできない。ポイントされた未解決問題群のうち改善が見られたのは約20%にとどまり、大半では既存記録を更新できない。
なぜそうなのか
進化的探索は「解の良し悪しを機械的に判定できる」問題にしか適用できず、評価が主観的・定性的な問題(証明の美しさ、数学的意義の大小)には原理的に弱い。
これからの予測の根拠
計算資源のスケールと探索アルゴリズムの改善が続く限り、人間には不可能な規模の探索という性質上、2027年には多くの構成的問題領域で人間超えの5に達すると予測。
いま使える主な道具
AlphaEvolve、FunSearch、CodeEvolve
根拠
- AlphaEvolve | What's new - Terence Tao 2025-2026
AlphaEvolveの数学的貢献に関するTaoの継続的な解説 - AI-powered Discovery of Counterexamples in Combinatorics, Final Report 2026
Sidorenko予想、Second Neighborhood予想等への適用と限界の報告 - AI for Mathematics: Progress, Challenges, and Prospects 2026
FunSearch/AlphaEvolveの2026年時点の到達点と課題を包括的にレビュー
同じ分野のほかの仕事(数学)
- 競技数学(IMO/Putnam級)
- 競技プログラミング(ICPC/IOI級アルゴリズム設計)
- 定理証明・形式化(Lean/Isabelle)
- 未解決問題への貢献(Erdős問題・主要予想)
- 数学論文の査読相当チェック(証明検証・誤り検出)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。