AIエージェント能力アトラス › 仕事ごとの一覧 › 基盤能力(横断) › 長時間タスクの完走
数日〜数週間規模のプロジェクト完走
Multi-day/multi-week project completion
2/52026年: 補助
2030年(予測): 4/5 専門家並み
2030年(予測): 4/5 専門家並み
02022
02023
12024
12025
22026
32027予
32028予
42030予
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
人間チームが数日かけるプロジェクトの定型的反復部分は代替できるが、非定型な意思決定を要する部分は監督が必須
できること
Claude Cowork Scheduled TasksやCodexの長時間ワークフローにより、日次/週次の定型反復タスクをスケジュール実行できる
まだできないこと
要件変化や例外処理を伴う非定型な数日規模プロジェクトの完全自律遂行はできない。OSWorld 2.0(人で1.6時間相当)でも最良システムは20.6%しか成功しない
なぜそうなのか
長時間タスクほど状態管理・目標維持・エラー訂正の複合的失敗が蓄積する
これからの予測の根拠
時間軸倍化トレンドの外挿では2027-28年に日単位定型タスクの高信頼化が見込まれるが、非定型プロジェクト全体の自律化はさらに先
いま使える主な道具
Claude Cowork、OpenAI Codex、Claude Code Routines
根拠
- The Hardest Easy Problem in AI: The State of Computer Use Agents 2026-07
OSWorld 2.0(人1.6時間規模)で最良システムでも成功率20.6% - Building Agents with Claude: From Skills to Scheduled Tasks and Routines 2026
Cowork Scheduled Tasksで週次実行の定型プロンプトは実現、非定型長期プロジェクトの保証はない
同じ分野のほかの仕事(長時間タスクの完走)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。