AIエージェント能力アトラス › 仕事ごとの一覧 › 研究・問題解決 › 数学
競技数学(IMO/Putnam級)
Olympiad-level competition mathematics
2030年(予測): 5/5 専門家超え
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
2025年IMOでGemini Deep ThinkとOpenAIの推論モデルが実際のコンテスト条件・自然言語問題で35/42点(金メダル基準と同点)を獲得、6問中5問を完答。金メダリスト集団(世界トップ層の高校生)と同水準だが、最難問(6問目)は依然解けていない。
できること
自然言語で提示された未見のIMO/Putnam級問題を、制限時間内・人手介入なしで高難度の5〜6問中5問程度まで解答できる。2024年時点のAlphaProof/AlphaGeometry2は問題文を形式言語に人手変換する必要があったが、2025年以降は自然言語のまま自律的に解答。
まだできないこと
最難問(例年の6問目)を安定して解けない。同一モデルでも試行によって成否がばらつき、公式コーディネーターによる採点(IMO公式ルール準拠)は限定的にしか実施されていない。真に独創的な補題の発見を要する問題では失敗率が上がる。
なぜそうなのか
探索空間が広い未知の補題発見には依然として弱く、大量のロールアウト・自己一致度チェックに依存するため計算コストが高い。訓練データに類似問題が乏しい真の新規性の高い問題で性能が落ちる。
これからの予測の根拠
2024年の銀メダル(人手介入あり)→2025年の金メダル(自然言語・自律)という1年での急伸を踏まえ、2027年までに6問完答・数分での解答が達成される可能性が高いとみて2027eを5とした。
いま使える主な道具
Gemini 3 Deep Think、Gemini 2.5 Deep Think、GPT-5.x (experimental reasoning model)、AlphaProof、AlphaGeometry 2
根拠
- Advanced version of Gemini with Deep Think officially achieves gold-medal standard at the IMO 2025-07
2025年IMOで35/42点、コーディネーター採点で金メダル水準と確認 - Google and OpenAI Get 2025 IMO Gold 2025-07
OpenAIも独自評価で35/42、両者とも問題1-5を正解、6のみ不正解 - AI Reasoning: Gold-Medal Performance at the 2025 IMO 2026
2026年に入っても金メダル級の継続的な性能が報告される一方、6問目の弱さは指摘され続けている - AI achieves silver-medal standard solving IMO problems 2024-07
2024年時点は銀メダル級(4/6問)、問題文の形式言語への人手変換が必要だった
同じ分野のほかの仕事(数学)
- 競技プログラミング(ICPC/IOI級アルゴリズム設計)
- 定理証明・形式化(Lean/Isabelle)
- 未解決問題への貢献(Erdős問題・主要予想)
- 大規模計算実験・構成的探索(AlphaEvolve/FunSearch型)
- 数学論文の査読相当チェック(証明検証・誤り検出)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。