AIエージェント能力アトラス › 仕事ごとの一覧 › 研究・問題解決 › 社会科学・経済・政策分析
因果推論・政策効果測定(プログラム評価)
Causal Inference & Program Evaluation
2030年(予測): 4/5 専門家並み
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
LLMは「確率的モデリングに依存し、真の因果関係よりも言語的パターンや社会的ステレオタイプに根差した疑似相関を捉えがち」であり、2026年に登場したAI評価RCTのガイドライン(33項目・5つの妥当性原則)は、AI自身の因果評価手法すら標準化が始まったばかりであることを示している。
できること
RCTプロトコル草案の作成支援、文献に基づく仮説生成、テキストからの候補交絡因子の特定、中程度の複雑さの因果探索ベンチマークでの再現。
まだできないこと
真の因果メカニズムと言語的・ステレオタイプ由来の疑似相関を確実に区別できない。計量経済学者の監督なしに実世界の政策RCTを自律的に設計・妥当性検証できない。学習データに近いパターンの外への因果推論の一般化ができない。
なぜそうなのか
LLMの因果推論は、根拠づけられた構造的・反実仮想モデリングではなく、因果的主張を記述したテキストに対するプロキシ的パターンマッチングに過ぎない。真の因果同定には交絡構造に関するドメイン知識が必要だが、テキストコーパスはそれを不均一かつ非一貫的にしか符号化していない。
これからの予測の根拠
2026年はAI評価そのものの因果的方法論(RCTガイドライン)が標準化され始めた年であり、これはAIが政策の因果評価を任される前提条件にすぎない。この方法論的基盤が成熟した後、2028-2030年にかけて能力向上が見込まれる。
いま使える主な道具
GPT-5.x、Claude Fable 5.1、causal discovery toolkits (DoWhy, CausalML) + LLM front-end
根拠
- Causal Inference with Large Language Model: A Survey 2025-2026
LLMは疑似相関を因果関係と誤認しがちと総括 - Principles and Guidelines for Randomized Controlled Trials in AI Evaluation 2026-05
AI評価RCTのための33項目のガイドラインを提案、標準化の初期段階であることを示す - Toward Causal Field Evaluations of AI Systems 2026
AIシステムの現実世界での因果評価手法がまだ未成熟と指摘
同じ分野のほかの仕事(社会科学・経済・政策分析)
- 経済予測・計量経済分析
- 政策シミュレーション・エージェントベースモデリング
- 社会調査・世論調査の被験者代理(シリコンサンプリング)
- 言説分析・世論分析(政治テキストの大規模アノテーション)
- 歴史・人文学研究支援
- 政策提言・報告書のエビデンス統合
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。