AIエージェント能力アトラス › 仕事ごとの一覧 › 研究・問題解決 › 文献調査・サーベイ

Deep Researchの自律タスク遂行時間(task horizon)

Autonomous Task Horizon for Deep Research

3/52026年: 実務品質(要確認)
2030年(予測): 5/5 専門家超え
02022
12023
22024
32025
32026
42027予
42028予
52030予

0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。

専門家と比べて

METR Time Horizon 1.1(2026年1月)によれば、AIエージェントが50%の成功率で完遂できるタスクの時間的長さは2024年以降どおり約3か月ごとに倍増しており、Deep Research用途では概ね5〜30分の自律探索が標準(人間アナリストの数時間〜数日の調査に相当する範囲を部分的にカバー)。

できること

1回の指示で数十のWebソースを横断し、5〜30分間の自律的な情報収集・矛盾点特定・構造化レポート作成を完遂できる。2026年2月以降はMCP接続や信頼ソース限定検索、進捗のリアルタイム追跡・途中修正も可能になった。

まだできないこと

METR自身が『Time Horizon 1.1の16時間超の推定値は信頼できない(タスクスイートが飽和している)』と警告しており、数日〜数週間かかるような本格的な文献調査プロジェクト全体を人手を介さず自律完遂できる水準にはまだ達していない。

なぜそうなのか

長時間タスクでは誤りの蓄積・文脈の逸脱・途中のセルフチェック不足が複合的に悪化するため、タスク時間の指数的増加に対してモデルの信頼性は追いついておらず、ベンチマーク自体も長時間タスクの評価が困難(飽和)になっている。

これからの予測の根拠

METRのダブリングトレンド(3-4か月ごとに倍増)が今後も続けば、2028年までに数時間規模の自律調査タスクの信頼性が実務品質に達すると予測されるが、METR自身が長時間タスクの測定限界(飽和)を指摘しており不確実性が大きい。

いま使える主な道具

OpenAI Deep Research、METR evaluation suite、Claude Fable 5.1、Gemini Deep Research

根拠

アトラス全体の地図をひらく →

同じ分野のほかの仕事(文献調査・サーベイ)

AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。