AIエージェント能力アトラス › 仕事ごとの一覧 › 基盤能力(横断) › 長時間タスクの完走

自律で完走できるタスクの長さ(50%成功の時間軸)

Autonomous task time horizon (50% success)

3/52026年: 実務品質(要確認)
2030年(予測): 5/5 専門家超え
02022
12023
22024
32025
32026
42027予
42028予
52030予

0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。

専門家と比べて

ジュニア〜中堅相当が数時間かけるタスクを50%の確率で完遂できる水準。専門家はほぼ確実に完遂するのに対しAIは約半分失敗する

できること

コーディング・リサーチ・データ分析など人が数十分〜半日かけるタスクを自律実行。50%成功の時間軸はOpus 4.6で約12時間(2026年8月時点)

まだできないこと

80%以上の高信頼度が必要な実務では実効時間軸はずっと短い。数日〜数週間規模のタスクは50%水準でも未達

なぜそうなのか

タスク長に対し成功率が指数関数的に減衰する『半減期』モデルが観測され、長時間になるほどエラー蓄積で信頼性が急落する

これからの予測の根拠

2019-2025年の倍化周期(直近4か月)が続けば2027年に月単位タスクへ到達するとMETR/AI Digestが推計。ただし倍化鈍化(コンピュート制約)の兆候も報告されている

いま使える主な道具

Claude Opus 4.6、GPT-5.x、METR HCAST/RE-Bench

根拠

アトラス全体の地図をひらく →

同じ分野のほかの仕事(長時間タスクの完走)

AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。