AIエージェント能力アトラス › 仕事ごとの一覧 › 基盤能力(横断) › ブラウザ/PC操作(GUI)
実務Webサイトでのタスク完遂
Real-world web task completion
3/52026年: 実務品質(要確認)
2030年(予測): 4/5 専門家並み
2030年(予測): 4/5 専門家並み
02022
02023
12024
22025
32026
32027予
42028予
42030予
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
定型的なWebタスク(検索・フォーム入力・情報収集)は実務品質だが、複雑な実務サイト(社内システム等)への適応は不安定
できること
GAIAベンチマークで91%超(Lemon Agent、2026年2月)、複数ステップのWeb調査・ファイル解析タスクをこなす
まだできないこと
BrowseCompのような『見つけにくい情報を深く探す』タスクは依然弱く、実サイトのA/Bテストやポップアップ、CAPTCHA等の変動要因で脆弱に壊れる
なぜそうなのか
整備されたベンチマークでの高スコアと、現実のWebの雑多な変動への頑健性は別問題
これからの予測の根拠
整備されたベンチマークでの高得点は続伸するが、現実サイトの頑健性改善は環境多様性への訓練データ拡充次第で2028年ごろ実務品質化
いま使える主な道具
Lemon Agent、OpenAI Operator系、Claude computer use
根拠
- Lemon Agent Technical Report 2026-02
GAIAベンチマークで91.36%の総合精度を達成(2026年2月時点) - Characterizing Unintended Consequences of GUI Agents For Web Browsing 2026
CHI 2026、GUIエージェントの意図せぬ実害(誤発注等)を報告
同じ分野のほかの仕事(ブラウザ/PC操作(GUI))
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。