AIエージェント能力アトラス › 仕事ごとの一覧 › 基盤能力(横断) › ブラウザ/PC操作(GUI)
デスクトップGUI操作(OSWorld系)
Desktop GUI operation (OSWorld-style)
3/52026年: 実務品質(要確認)
2030年(予測): 4/5 専門家並み
2030年(予測): 4/5 専門家並み
02022
02023
12024
22025
32026
32027予
42028予
42030予
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
簡単な業務アプリ操作(ファイル整理、定型入力)は代替可能だが、専門ソフトの熟練操作には遠く及ばない
できること
OSWorldベンチマークで2024年4月の12%成功から2026年6月には約85%(単純タスク)まで上昇。Agent S3は62.6%(単独)〜69.9%(Best-of-10)
まだできないこと
OSWorld 2.0の長時間タスク(人で1.6時間相当)では最良システムでも20.6%しか完遂できず、複雑な現実業務には未対応
なぜそうなのか
短時間・単純操作のベンチマークで急速に飽和した一方、長時間・複合操作のベンチマークでは進歩が緩やか(ベンチマークの難易度シフト)
これからの予測の根拠
短時間タスクは飽和済みのため今後の指標はOSWorld 2.0等の長時間版に移行。2028年ごろ長時間版でも実務品質(50%超)到達が見込まれる
いま使える主な道具
Agent S3、UFO2、Claude computer use
根拠
- The Hardest Easy Problem in AI: The State of Computer Use Agents 2026-07
OSWorldは12%→85%へ、OSWorld 2.0では最良でも20.6% - UI-CUBE: Enterprise-Grade Computer Use Agent Benchmarking 2025-11
運用信頼性まで含めた評価でギャップを可視化
同じ分野のほかの仕事(ブラウザ/PC操作(GUI))
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。