AIエージェント能力アトラス › 仕事ごとの一覧 › 研究・問題解決 › 文献調査・サーベイ

システマティックレビュー相当の再現性・PRISMA準拠

Systematic Review Reproducibility (PRISMA-grade)

2/52026年: 補助
2030年(予測): 4/5 専門家並み
02022
12023
12024
22025
22026
32027予
32028予
42030予

0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。

専門家と比べて

Cochraneは約15件のレビュー更新でAIツールを試験導入中だが、独立した完全自動レビューは認めていない。人間スクリーニングの再現率85.2%に対し、AI単独手法はそれを下回るケースがあり、人間監督付きのタイトル/抄録スクリーニングのみ『AI活用可』とされている。

できること

タイトル・抄録スクリーニング、データ抽出、リスクオブバイアス評価の下書きを支援し、作業量を50-75%削減できる(人間監督前提)。デュアルモデルアンサンブルでスクリーニング感度がほぼ完全に近づいたとする2025年の検証研究もある。

まだできないこと

生成AIは系統的レビューの中核的方法論ステップ(プロトコル事前登録に基づく網羅的検索式設計、二重独立スクリーニングの完全代替など)を独立して信頼性高く遂行できないとCochrane系のスコーピングレビューで明言されている。AI検索は透明性・再現性の面で従来の系統的検索式に劣る。

なぜそうなのか

PRISMA準拠のレビューは『検索式の網羅性の事前定義』と『バイアスの体系的排除』という監査可能なプロセスの厳密性を要求するが、LLMの検索・判断はブラックボックス的で試行間の再現性が保証されないため、規制・査読上の要求水準を満たせない。

これからの予測の根拠

Cochraneの試験導入(約15件)の結果次第だが、人間監督付きスクリーニングの実務品質化は進展中。完全自動でのPRISMA準拠達成にはプロトコル網羅性の監査可能性という制度的ハードルが残り、2028年時点でも専門家並みには届かないと予測。

いま使える主な道具

Elicit、Covidence+AI、Cochrane RevMan AI機能(試験中)、Rayyan

根拠

アトラス全体の地図をひらく →

同じ分野のほかの仕事(文献調査・サーベイ)

AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。