AIエージェント能力アトラス › 仕事ごとの一覧 › 研究・問題解決 › 文献調査・サーベイ

複数論文の統合・比較(データ抽出含む)

Multi-Paper Synthesis & Data Extraction

3/52026年: 実務品質(要確認)
2030年(予測): 5/5 専門家超え
12022
22023
32024
32025
32026
42027予
42028予
52030予

0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。

専門家と比べて

Elicitはシステマティックレビューのデータ抽出タスクで81.4%の精度(人間レビュアー86.7%と統計的有意差なし)、別評価では99.4%の一致率を達成しており、定型的なデータ抽出では人間レビュアーに匹敵する場面がある。

できること

PDF論文群から研究デザイン・サンプルサイズ・アウトカムなどの構造化データを高精度で抽出し、比較表を自動生成できる。スクリーニング感度は約97%との報告もあり、大量論文の一次スクリーニングの負荷を50-75%削減する。

まだできないこと

『AI合成は真の学術的意見対立を均してしまい、見せかけの合意(false consensus)に向かう傾向がある』と指摘されており、対立する知見のニュアンスを保持した統合は苦手。網羅的な検索そのもの(生成AIによる検索は関連研究の大部分を見逃す)は専門家の系統的検索に劣る。

なぜそうなのか

統合作業は個々の論文の方法論的な質・妥当性を評価した上で選択的に重み付けする必要があるが、LLMは表面的なテキスト類似性に基づいて『滑らかな』要約を生成しがちで、方法論上の欠陥を能動的に割り引く判断が弱い。

これからの予測の根拠

データ抽出精度が既に人間と有意差なしの水準に達している一方、網羅的検索と対立知見の保持は改善が遅く、2028年時点でも『実務品質(要確認)』を維持し専門家並みへの到達は部分的と予測。

いま使える主な道具

Elicit、Consensus、Claude Fable 5.1 Research、Semantic Scholar API + LLM

根拠

アトラス全体の地図をひらく →

同じ分野のほかの仕事(文献調査・サーベイ)

AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。