AIエージェント能力アトラス › 仕事ごとの一覧 › 基盤能力(横断) › 自己検証・信頼性
自己検証・出力チェック
Self-verification and output checking
3/52026年: 実務品質(要確認)
2030年(予測): 4/5 専門家並み
2030年(予測): 4/5 専門家並み
02022
12023
22024
22025
32026
32027予
42028予
42030予
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
専門家の『納品前レビュー』相当の自己チェックは部分的に機能するが、自分の思い込みは自分では見つけにくい構造的問題がある
できること
コード実行結果の確認、簡単な計算検算、フォーマット遵守チェックは実務品質
まだできないこと
自身の推論プロセス全体の誤りに気づく『メタ認知的』自己検証は弱く、独立した第三者(別エージェント/人間)によるレビューの方が有効
なぜそうなのか
自己評価が甘くなるのは訓練上の理由(自身の出力に対する強いバイアス)によるもので、単純なプロンプト改善では解決しにくい
これからの予測の根拠
独立検証エージェントを組み合わせるマルチエージェント検証パターンの普及により2028年ごろ実務品質が向上する見込み
いま使える主な道具
Claude、self-consistency手法、独立検証エージェント
根拠
- Uncertainty Quantification in LLM Agents: Foundations, Emerging Challenges, and Opportunities 2026-02
自己検証と不確実性定量化に関する44本のサーベイ
同じ分野のほかの仕事(自己検証・信頼性)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。