AIエージェント能力アトラス › 仕事ごとの一覧 › 基盤能力(横断) › 安全性・アラインメント・制御
ジェイルブレイク・敵対的攻撃への頑健性
Robustness to jailbreaks and adversarial attacks
3/52026年: 実務品質(要確認)
2030年(予測): 4/5 専門家並み
2030年(予測): 4/5 専門家並み
12022
12023
22024
22025
32026
32027予
42028予
42030予
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
レッドチームの人間専門家によるジェイルブレイク耐性テストと比べ、モデルは既知の攻撃パターンには強くなったが新規の攻撃手法にはなお脆弱
できること
既知のジェイルブレイクパターン(ロールプレイ誘導等)への耐性は大幅に向上し、Constitutional AI等の手法で明確な拒否を実現している
まだできないこと
新規性の高い攻撃(多段階・多言語・エンコーディングを組み合わせた攻撃)には依然として突破される事例が報告される
なぜそうなのか
防御は既知の攻撃パターンの学習に依存する部分が大きく、いたちごっこの構造から抜け出せていない
これからの予測の根拠
自動化されたレッドチーミング(AIによるAI攻撃探索)の普及で2028年に検出速度は上がるが、根絶は難しいと予測
いま使える主な道具
Claude Constitutional AI、OpenAI safety training
根拠
- International AI Safety Report 2026 2026-02
各国政府が合同でまとめたAI安全性の最新状況報告、ジェイルブレイク耐性の到達点と限界を含む
同じ分野のほかの仕事(安全性・アラインメント・制御)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。