AIエージェント能力アトラス › 仕事ごとの一覧 › ソフトウェア開発 › レビュー・テスト・品質保証
生成したコードの正しさを自己検証する(セルフレビュー)
Self-verify correctness of generated code
2/52026年: 補助
2030年(予測): 3/5 実務品質(要確認)
2030年(予測): 3/5 実務品質(要確認)
12022
12023
22024
22025
22026
32027予
32028予
32030予
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
自己レビューの質はジュニア未満。過信により見落としを『問題なし』と報告する傾向が強い
できること
構文エラー・型エラー・テスト失敗など機械的に検証可能な誤りは確実に自己修正
まだできないこと
自分の実装が意図とズレていることの自覚、過信に基づく『できました』の誤報告
なぜそうなのか
自己評価が甘いのは訓練上の理由(人間の好む出力を強化学習で最適化した結果、自信過剰な報告が生まれやすい)
これからの予測の根拠
自己評価の甘さは強化学習からの好感度バイアスに根差す構造的課題で、モデル単体の性能向上だけでは解消しにくく停滞予測
いま使える主な道具
Claude Code、GitHub Copilot
根拠
- Habituation at the Gate: Rising Approval and Declining Scrutiny in Human Review of AI Agent Code 2026-06
400人のレビュアーの1万1千件超のレビューで承認率が+14.5ポイント上昇、インラインコメントが22%減少する『慣れ』現象を確認 - Vibe Coding's Security Debt: The AI-Generated CVE Surge 2026-04
Fortune 50企業でAI支援開発者はコミット速度3〜4倍だがセキュリティ指摘は10倍という非対称性
同じ分野のほかの仕事(レビュー・テスト・品質保証)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。