AIエージェント能力アトラス › 仕事ごとの一覧 › 基盤能力(横断) › 安全性・アラインメント・制御
エージェントの目標ハイジャック防御
Agent goal hijack prevention
2/52026年: 補助
2030年(予測): 3/5 実務品質(要確認)
2030年(予測): 3/5 実務品質(要確認)
02022
02023
12024
12025
22026
22027予
32028予
32030予
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
権限管理者が行う最小権限原則の考え方はエージェント設計にも応用され始めているが、実装は発展途上
できること
能力ベース設計(capability-based design)やデュアルモデル分離により被害範囲を限定する設計パターンが普及し始め、ゴール変更への人間承認必須化も広がっている
まだできないこと
OWASP Top 10 for Agentic Applications 2026でASI01(Agent Goal Hijacking)が最大リスクに認定されるほど未解決。マルチエージェント間の制御フロー乗っ取りへの防御は『破っては直す』のいたちごっこ状態
なぜそうなのか
エージェントの自律性そのものが攻撃対象になり、単一エージェント向けの防御をマルチエージェント構成にそのまま適用できない
これからの予測の根拠
OWASPが2025年末にランキングを確立したばかりで、防御パターンの標準化は2027-28年にかけて進むと見込まれるが根絶は困難
いま使える主な道具
OWASP ASI Top 10、capability-based agent design
根拠
- What is agent goal hijack? | Tutorial & examples 2026
OWASP ASI01としてエージェント目標ハイジャックが最大リスクに認定 - Breaking and Fixing Defenses Against Control-Flow Hijacking in Multi-Agent Systems 2025-10
マルチエージェントの制御フロー乗っ取り防御のいたちごっこを実証
同じ分野のほかの仕事(安全性・アラインメント・制御)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。