AIエージェント能力アトラス › 仕事ごとの一覧 › 研究・問題解決 › 自然科学
論文の再現実験(Reproducibility)
Reproducing Published Research
2030年(予測): 4/5 専門家並み
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
コードとデータが公開済みの計算系研究の再現ではジュニア研究者に近い成功率を出す場合があるが、難度が上がる(新規データ取得が必要、非計算系の実験)と成功率が急落し、専門家との差が顕著に開く。
できること
公開コード・データを用いた計算論文の再現実行、環境構築・依存関係解決の自動化(CORE-Bench等で評価)。
まだできないこと
新規データ取得が必要な再現、天文学・社会科学など専門知識依存度の高い分野での高精度な再現判定。あるベンチマークでは易しいタスクで60%の精度に対し、最も難しいタスクでは21%まで低下。
なぜそうなのか
再現には『コードを動かす』以上に、暗黙知(実験室固有の手順、データクリーニングの非公開な判断)が必要な場合が多く、LLMエージェントはそれらの文脈を文献から読み取れない。
これからの予測の根拠
計算系分野は自動化ツールの整備で2028年に実務品質へ近づくが、新規データ取得を要する再現は湿式実験の自律化(同じく本アトラス内で足踏み)が前提となるため、2030年でようやく専門家並みの一部到達を見込む。
いま使える主な道具
CORE-Bench agents、AstaBench、NatureBench、ReplicatorBench
根拠
- CORE-Bench: Fostering the Credibility of Published Research Through a Computational Reproducibility Agent Benchmark 2024-09
計算論文の再現をAIエージェントが行うベンチマークを提示 - REPRO-Bench: Can AI agents Automate Research Reproducibility Assessments? 2026
タスク難度により精度が60%から21%まで低下 - AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite 2025-10
科学研究エージェントの再現性を含む多面的ベンチマークスイート
同じ分野のほかの仕事(自然科学)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。