AIエージェント能力アトラス › 仕事ごとの一覧 › 基盤能力(横断) › ブラウザ/PC操作(GUI)
現実世界の変動要因への頑健性
Robustness to real-world UI variability
2/52026年: 補助
2030年(予測): 4/5 専門家並み
2030年(予測): 4/5 専門家並み
02022
02023
12024
12025
22026
22027予
32028予
42030予
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
熟練オペレーターはUIの微小な変化に即座に適応するが、AIエージェントはセレクタのずれや動的要素で容易に破綻する
できること
action-effect検証を組み込んだ設計で一部の失敗を検知・自己修正できる
まだできないこと
ネットワーク遅延・レンダリング遅延・ポップアップ・CAPTCHA等『良性の変動』ですら壊れやすく、数量未入力での誤発注や住所欄への文字列混入など実害のある誤操作が報告されている
なぜそうなのか
GUIエージェントは行動が意図通り実行されたことを暗黙に仮定する設計が多く、現実の非決定性への頑健性が構造的に不足
これからの予測の根拠
action-effect verification等の自己修正機構の実装が進めば2028年ごろ実務品質(要確認)まで改善する可能性
いま使える主な道具
UFO2、Claude computer use、各種ブラウザエージェントフレームワーク
根拠
- Characterizing Unintended Consequences of GUI Agents For Web Browsing 2026
CHI 2026、誤発注・誤入力等の具体的実害事例を報告 - Don't Act Blindly: Robust GUI Automation via Action-Effect Verification and Self-Correction 2026-04
『行動が意図通り実行された』という暗黙の仮定の危うさを指摘
同じ分野のほかの仕事(ブラウザ/PC操作(GUI))
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。