AIエージェント能力アトラス › 仕事ごとの一覧 › 研究・問題解決 › 社会科学・経済・政策分析

政策提言・報告書のエビデンス統合

Policy Brief & Evidence Synthesis Drafting

2/52026年: 補助
2030年(予測): 4/5 専門家並み
12022
22023
22024
22025
22026
32027予
32028予
42030予

0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。

専門家と比べて

南アフリカの国家AI政策草案・EUのENISA・Deloitte Australiaなど複数の政府/コンサル機関が2025-2026年にAIによる架空引用を含む政策文書を公表し撤回・返金に至っており、現状の実務運用はジュニアアナリスト以下の信頼性しかない(厳格な検証なしでは)。

できること

大量の政策関連文書を高速に要約・統合し政策ブリーフの骨子を構造化できる。

まだできないこと

架空でない正確な引用・出典を安定して生成できない。一般公開される政府の政策文書に無監督で使うことはできない。自身のハルシネーションした参照を自己検出できない。

なぜそうなのか

2026年のベンチマークではトップモデルのハルシネーション率が22〜94%に及ぶと報告されており、引用検証をワークフローに組み込む仕組みが標準化されておらず、政府・コンサル現場でRAG等の緩和策が一様に適用されていない。

これからの予測の根拠

2026年に南アフリカ政策撤回・Deloitte返金・ENISA誤り等の高プロファイルな失敗が繰り返されており構造的な解決策はまだない。法曹界で進むAI開示証明のような検証義務化が政策分野にも波及すれば2028年頃に改善が見込まれるが、2026年時点では実態としてレベル2にとどまる。

いま使える主な道具

GPT-5.x、Claude Fable 5.1、Gemini 3 (with RAG/citation-check gates)

根拠

アトラス全体の地図をひらく →

同じ分野のほかの仕事(社会科学・経済・政策分析)

AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。