AIエージェント能力アトラス › 仕事ごとの一覧 › 事務・ビジネス › 社内ナレッジ検索・RAG / 定型業務自動化(RPA代替)
長時間PC操作タスクの自律遂行
Long-horizon autonomous computer-use task execution
2/52026年: 補助
2030年(予測): 4/5 専門家並み
2030年(予測): 4/5 専門家並み
02022
02023
12024
22025
22026
32027予
32028予
42030予
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
OSWorld 2.0(長時間タスク)ではトップモデルでも完遂率20.6%にとどまり、人間の代替にはまだ遠い
できること
数十ステップ規模の定型操作の代行(短時間タスク中心のOSWorld 1.0では人間基準72%を上回るスコアも報告)
まだできないこと
平均318回のツール呼び出しを要する長時間タスクの安定完遂、想定外のエラー・ポップアップからの自己修復
なぜそうなのか
タスクが長くなるほど途中のわずかなエラーが複利的に蓄積し崩壊する『長距離タスクの脆弱性』が根本課題。METRの時間軸調査でも80%成功基準では3-4時間が限界
これからの予測の根拠
METRの時間軸は4-7ヶ月ごとに倍増する傾向があり2027年には月単位のタスク遂行が視野に入るとの予測がある一方、80%信頼度基準では成長が緩やかで2030年でも数日規模のタスクが上限になる可能性
いま使える主な道具
Claude computer use / Cowork、OpenAI Operator / ChatGPT Work、Gemini Computer Use
根拠
- OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks 2026-06
最良エージェントでも平均318回のツール呼び出しを要する長時間タスクの完遂率は20.6% - Time Horizon 1.1 2026-01
2026年前半時点で50%成功基準は16-20時間、80%成功基準では3-4時間が限界 - Claude Cowork GA: Anthropic Inverts the Enterprise Agent Rollout Pattern 2026-05
2026年4月9日に全有料プランへGA、権限管理機能を同時提供するも長時間タスクの信頼性は課題として残る
同じ分野のほかの仕事(社内ナレッジ検索・RAG / 定型業務自動化(RPA代替))
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。