AIエージェント能力アトラス › 仕事ごとの一覧 › 研究・問題解決 › 数学

競技数学(IMO/Putnam級)

Olympiad-level competition mathematics

5/52026年: 専門家超え
2030年(予測): 5/5 専門家超え
02022
12023
32024
52025
52026
52027予
52028予
52030予

0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。

専門家と比べて

2025年IMOでGemini Deep ThinkとOpenAIの推論モデルが実際のコンテスト条件・自然言語問題で35/42点(金メダル基準と同点)を獲得、6問中5問を完答。金メダリスト集団(世界トップ層の高校生)と同水準だが、最難問(6問目)は依然解けていない。

できること

自然言語で提示された未見のIMO/Putnam級問題を、制限時間内・人手介入なしで高難度の5〜6問中5問程度まで解答できる。2024年時点のAlphaProof/AlphaGeometry2は問題文を形式言語に人手変換する必要があったが、2025年以降は自然言語のまま自律的に解答。

まだできないこと

最難問(例年の6問目)を安定して解けない。同一モデルでも試行によって成否がばらつき、公式コーディネーターによる採点(IMO公式ルール準拠)は限定的にしか実施されていない。真に独創的な補題の発見を要する問題では失敗率が上がる。

なぜそうなのか

探索空間が広い未知の補題発見には依然として弱く、大量のロールアウト・自己一致度チェックに依存するため計算コストが高い。訓練データに類似問題が乏しい真の新規性の高い問題で性能が落ちる。

これからの予測の根拠

2024年の銀メダル(人手介入あり)→2025年の金メダル(自然言語・自律)という1年での急伸を踏まえ、2027年までに6問完答・数分での解答が達成される可能性が高いとみて2027eを5とした。

いま使える主な道具

Gemini 3 Deep Think、Gemini 2.5 Deep Think、GPT-5.x (experimental reasoning model)、AlphaProof、AlphaGeometry 2

根拠

アトラス全体の地図をひらく →

同じ分野のほかの仕事(数学)

AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。