AIエージェント能力アトラス › 仕事ごとの一覧 › 研究・問題解決 › 文献調査・サーベイ
システマティックレビュー相当の再現性・PRISMA準拠
Systematic Review Reproducibility (PRISMA-grade)
2030年(予測): 4/5 専門家並み
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
Cochraneは約15件のレビュー更新でAIツールを試験導入中だが、独立した完全自動レビューは認めていない。人間スクリーニングの再現率85.2%に対し、AI単独手法はそれを下回るケースがあり、人間監督付きのタイトル/抄録スクリーニングのみ『AI活用可』とされている。
できること
タイトル・抄録スクリーニング、データ抽出、リスクオブバイアス評価の下書きを支援し、作業量を50-75%削減できる(人間監督前提)。デュアルモデルアンサンブルでスクリーニング感度がほぼ完全に近づいたとする2025年の検証研究もある。
まだできないこと
生成AIは系統的レビューの中核的方法論ステップ(プロトコル事前登録に基づく網羅的検索式設計、二重独立スクリーニングの完全代替など)を独立して信頼性高く遂行できないとCochrane系のスコーピングレビューで明言されている。AI検索は透明性・再現性の面で従来の系統的検索式に劣る。
なぜそうなのか
PRISMA準拠のレビューは『検索式の網羅性の事前定義』と『バイアスの体系的排除』という監査可能なプロセスの厳密性を要求するが、LLMの検索・判断はブラックボックス的で試行間の再現性が保証されないため、規制・査読上の要求水準を満たせない。
これからの予測の根拠
Cochraneの試験導入(約15件)の結果次第だが、人間監督付きスクリーニングの実務品質化は進展中。完全自動でのPRISMA準拠達成にはプロトコル網羅性の監査可能性という制度的ハードルが残り、2028年時点でも専門家並みには届かないと予測。
いま使える主な道具
Elicit、Covidence+AI、Cochrane RevMan AI機能(試験中)、Rayyan
根拠
- Artificial Intelligence Resources for the Screening of Titles and Abstracts in Systematic Reviews: A Scoping Review 2026
Cochrane Evidence Synthesis and Methods誌、AIは人間監督付きスクリーニングのみ現状『readiness』ありと結論 - Dual-Model LLM Ensemble via Web Chat Interfaces Reaches Near-Perfect Sensitivity for Systematic-Review Screening 2025-11
デュアルモデルアンサンブルでスクリーニング感度がほぼ完全に近づいたとする検証 - AI in Systematic Reviews - LibGuides at Oregon Health & Science University 2026
生成AIは中核的方法論ステップを独立して信頼性高く遂行できないと明言
同じ分野のほかの仕事(文献調査・サーベイ)
- Deep Researchの網羅的調査・精度
- 幻覚引用・存在しない論文の捏造問題
- 複数論文の統合・比較(データ抽出含む)
- 最新研究動向の把握・トレンド追跡
- Deep Researchの自律タスク遂行時間(task horizon)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。