AIエージェント能力アトラス › 仕事ごとの一覧 › 基盤能力(横断) › 安全性・アラインメント・制御

エージェントの目標ハイジャック防御

Agent goal hijack prevention

2/52026年: 補助
2030年(予測): 3/5 実務品質(要確認)
02022
02023
12024
12025
22026
22027予
32028予
32030予

0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。

専門家と比べて

権限管理者が行う最小権限原則の考え方はエージェント設計にも応用され始めているが、実装は発展途上

できること

能力ベース設計(capability-based design)やデュアルモデル分離により被害範囲を限定する設計パターンが普及し始め、ゴール変更への人間承認必須化も広がっている

まだできないこと

OWASP Top 10 for Agentic Applications 2026でASI01(Agent Goal Hijacking)が最大リスクに認定されるほど未解決。マルチエージェント間の制御フロー乗っ取りへの防御は『破っては直す』のいたちごっこ状態

なぜそうなのか

エージェントの自律性そのものが攻撃対象になり、単一エージェント向けの防御をマルチエージェント構成にそのまま適用できない

これからの予測の根拠

OWASPが2025年末にランキングを確立したばかりで、防御パターンの標準化は2027-28年にかけて進むと見込まれるが根絶は困難

いま使える主な道具

OWASP ASI Top 10、capability-based agent design

根拠

アトラス全体の地図をひらく →

同じ分野のほかの仕事(安全性・アラインメント・制御)

AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。