AIエージェント能力アトラス › 仕事ごとの一覧 › 研究・問題解決 › 文献調査・サーベイ
複数論文の統合・比較(データ抽出含む)
Multi-Paper Synthesis & Data Extraction
2030年(予測): 5/5 専門家超え
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
Elicitはシステマティックレビューのデータ抽出タスクで81.4%の精度(人間レビュアー86.7%と統計的有意差なし)、別評価では99.4%の一致率を達成しており、定型的なデータ抽出では人間レビュアーに匹敵する場面がある。
できること
PDF論文群から研究デザイン・サンプルサイズ・アウトカムなどの構造化データを高精度で抽出し、比較表を自動生成できる。スクリーニング感度は約97%との報告もあり、大量論文の一次スクリーニングの負荷を50-75%削減する。
まだできないこと
『AI合成は真の学術的意見対立を均してしまい、見せかけの合意(false consensus)に向かう傾向がある』と指摘されており、対立する知見のニュアンスを保持した統合は苦手。網羅的な検索そのもの(生成AIによる検索は関連研究の大部分を見逃す)は専門家の系統的検索に劣る。
なぜそうなのか
統合作業は個々の論文の方法論的な質・妥当性を評価した上で選択的に重み付けする必要があるが、LLMは表面的なテキスト類似性に基づいて『滑らかな』要約を生成しがちで、方法論上の欠陥を能動的に割り引く判断が弱い。
これからの予測の根拠
データ抽出精度が既に人間と有意差なしの水準に達している一方、網羅的検索と対立知見の保持は改善が遅く、2028年時点でも『実務品質(要確認)』を維持し専門家並みへの到達は部分的と予測。
いま使える主な道具
Elicit、Consensus、Claude Fable 5.1 Research、Semantic Scholar API + LLM
根拠
- Evaluating the AI Tool "Elicit" as a Semi-Automated Second Reviewer for Data Extraction in Systematic Reviews 2025
Elicitのデータ抽出精度81.4% vs 人間86.7%(有意差なし) - Comparison of Elicit AI and Traditional Literature Searching in Systematic Reviews using Four Case Studies 2025-06
AI検索は関連研究の大部分を見逃す、網羅性で専門家検索に劣る - Safeguards against GenAI hallucination in literature reviews 2026
AI合成が学術的対立を均し見せかけの合意に向かう傾向を指摘
同じ分野のほかの仕事(文献調査・サーベイ)
- Deep Researchの網羅的調査・精度
- 幻覚引用・存在しない論文の捏造問題
- システマティックレビュー相当の再現性・PRISMA準拠
- 最新研究動向の把握・トレンド追跡
- Deep Researchの自律タスク遂行時間(task horizon)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。