AIエージェント能力アトラス › 仕事ごとの一覧 › 基盤能力(横断) › 安全性・アラインメント・制御
プロンプトインジェクションへの耐性
Resistance to prompt injection
2030年(予測): 3/5 実務品質(要確認)
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
セキュリティエンジニアが行う入力サニタイズは明確な境界を引けるが、自然言語ベースのエージェントは信頼できる指示と信頼できないデータの境界を構造的に引けない
できること
スポットライティング(区切り文字/base64での分離)、ツール応答の隔離、システムプロンプトの改変防止などの緩和策の実装が進んでいる
まだできないこと
間接プロンプトインジェクションは未解決。2026年3月にOasis Securityがclaude.aiに対し『Claudy Day』攻撃(不可視インジェクション+データ持ち出し、追加ツール不要)を実証。Microsoft 365 CopilotでもCVSS 9.3の攻撃が報告された
なぜそうなのか
自然言語では『命令』と『データ』を構文的に分離できないという設計上の根本問題があり、単一のプロンプト調整では解決しない
これからの予測の根拠
Five Eyes(国際情報機関連合)も『高リスク意思決定には人の監督を残す段階的展開』を推奨しており、2028年までの完全解決は業界内で期待されていない(停滞領域)
いま使える主な道具
Claude、Microsoft 365 Copilot、OWASP Top 10 for Agentic Applications
根拠
- Indirect prompt injection is taking hold in the wild 2026-04
間接プロンプトインジェクションの実運用被害が拡大していると報告 - 5 Real AI Agent Security Breaches in 2026 and Their Lessons 2026
Claudy Day攻撃を含む2026年の実被害事例をまとめる
同じ分野のほかの仕事(安全性・アラインメント・制御)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。