AIエージェント能力アトラス › 仕事ごとの一覧 › 基盤能力(横断) › 長時間タスクの完走
長時間実行中のエラー蓄積からの回復
Recovery from accumulated errors in long runs
2/52026年: 補助
2030年(予測): 4/5 専門家並み
2030年(予測): 4/5 専門家並み
02022
12023
12024
22025
22026
32027予
32028予
42030予
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
熟練者は途中のミスに気づき軌道修正するのが当然だが、AIエージェントは誤りの検知・訂正が遅れ、誤りの上に誤りを重ねる傾向が強い
できること
action-effect verification(操作結果の確認)を組み込んだエージェントは一部のGUI操作ミスを自己修正できる
まだできないこと
長時間実行中に蓄積した誤り(初期の誤クリック等)からの巻き戻し・根本原因の遡及的訂正は弱く、誤り率が雪だるま式に増える
なぜそうなのか
長時間タスク失敗研究の多くで、初期の小さな誤解釈が後続ステップに伝播する『エラー伝播』が主要因と特定されている
これからの予測の根拠
実行時プラン検証・修復(execution-time plan verification and repair)の研究が進めば2027-28年に中程度の改善が見込まれるが根本解決の時期は不明
いま使える主な道具
UFO2 Desktop AgentOS、Claude Code、Action-Effect Verification系エージェント
根拠
- Don't Act Blindly: Robust GUI Automation via Action-Effect Verification and Self-Correction 2026-04
行動結果の検証を組み込むことでGUI操作の自己修正が可能になると報告 - The Long-Horizon Task Mirage? Diagnosing Where and Why Agentic Systems Break 2026-04
長時間タスクの失敗箇所と原因を診断
同じ分野のほかの仕事(長時間タスクの完走)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。