AIエージェント能力アトラス › 仕事ごとの一覧 › 研究・問題解決 › 社会科学・経済・政策分析

因果推論・政策効果測定(プログラム評価)

Causal Inference & Program Evaluation

2/52026年: 補助
2030年(予測): 4/5 専門家並み
12022
12023
22024
22025
22026
32027予
32028予
42030予

0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。

専門家と比べて

LLMは「確率的モデリングに依存し、真の因果関係よりも言語的パターンや社会的ステレオタイプに根差した疑似相関を捉えがち」であり、2026年に登場したAI評価RCTのガイドライン(33項目・5つの妥当性原則)は、AI自身の因果評価手法すら標準化が始まったばかりであることを示している。

できること

RCTプロトコル草案の作成支援、文献に基づく仮説生成、テキストからの候補交絡因子の特定、中程度の複雑さの因果探索ベンチマークでの再現。

まだできないこと

真の因果メカニズムと言語的・ステレオタイプ由来の疑似相関を確実に区別できない。計量経済学者の監督なしに実世界の政策RCTを自律的に設計・妥当性検証できない。学習データに近いパターンの外への因果推論の一般化ができない。

なぜそうなのか

LLMの因果推論は、根拠づけられた構造的・反実仮想モデリングではなく、因果的主張を記述したテキストに対するプロキシ的パターンマッチングに過ぎない。真の因果同定には交絡構造に関するドメイン知識が必要だが、テキストコーパスはそれを不均一かつ非一貫的にしか符号化していない。

これからの予測の根拠

2026年はAI評価そのものの因果的方法論(RCTガイドライン)が標準化され始めた年であり、これはAIが政策の因果評価を任される前提条件にすぎない。この方法論的基盤が成熟した後、2028-2030年にかけて能力向上が見込まれる。

いま使える主な道具

GPT-5.x、Claude Fable 5.1、causal discovery toolkits (DoWhy, CausalML) + LLM front-end

根拠

アトラス全体の地図をひらく →

同じ分野のほかの仕事(社会科学・経済・政策分析)

AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。