AIエージェント能力アトラス › 仕事ごとの一覧 › 研究・問題解決 › 文献調査・サーベイ
Deep Researchの網羅的調査・精度
Deep Research Comprehensive Investigation Accuracy
2030年(予測): 5/5 専門家超え
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
DeepResearch BenchのRACEフレームワークではGemini-2.5-Pro Deep Researchが総合トップ(48.88)、OpenAI Deep Researchが僅差(46.98)。ただしFACTフレームワークでは最良タスクでも事実精度85%を超える製品は無く、専門リサーチャーの厳密性には届いていない。
できること
5〜30分で数十のソースを横断検索し、矛盾点の指摘や構造化された引用付きレポートを自律生成できる。2026年2月更新でMCP/アプリ連携や信頼ソース限定検索、進捗のリアルタイム追跡・割り込み修正も可能になった。
まだできないこと
FACTフレームワークで示される通り、いずれの製品も事実精度85%の壁を越えられておらず、複雑な学際的問い・一次資料の精査が必要な問いでは表層的な要約に留まりやすい。DRACOベンチマークでもPerplexity(70.5%)以外は正答率が50〜60%台に留まる領域がある。
なぜそうなのか
Deep Researchは検索結果の要約・統合を行うが、個々のソースの信頼性評価や矛盾する一次資料の重み付けという専門家的判断を体系的には行えず、検索順位や表層的な一致度に引きずられやすい。
これからの予測の根拠
RACE/FACTスコアが年々改善しているトレンドと、ソース検証機構(信頼ソース限定検索など)の実装拡大から、2028年までに事実精度85%の壁を突破し専門家並みに近づく可能性が高い。
いま使える主な道具
OpenAI Deep Research (o3)、Gemini 2.5/3 Deep Research、Perplexity Deep Research、Claude Fable 5.1 Research
根拠
- DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents 2026
RACEフレームワークでGemini-2.5-Pro DeepResearch首位(48.88)、FACTで最良でも85%未満 - DRACO: a Cross-Domain Benchmark for Deep Research 2026-02
Perplexity Deep Researchが70.5%で最高、他は50%台に留まる領域があると報告 - Introducing deep research | OpenAI 2026-02
MCP接続・信頼ソース限定・リアルタイム進捗追跡の機能拡張
同じ分野のほかの仕事(文献調査・サーベイ)
- 幻覚引用・存在しない論文の捏造問題
- 複数論文の統合・比較(データ抽出含む)
- システマティックレビュー相当の再現性・PRISMA準拠
- 最新研究動向の把握・トレンド追跡
- Deep Researchの自律タスク遂行時間(task horizon)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。