AIエージェント能力アトラス › 仕事ごとの一覧 › 研究・問題解決 › データ分析・統計
因果推論
Causal Inference
2030年(予測): 4/5 専門家並み
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
計量経済学者・因果推論の専門家と比べ、LLM単体の因果推定精度は低く、2026年の論文でも『ランダムに近い性能』と評されるケースがある。DAG(因果図)の候補提示など補助タスクでは有用。
できること
介入変数候補やDAGの叩き台を提示したり、既知の因果推論手法(DID, IV, RDDなど)の選択肢を説明したりする定型的な補助はできる。GPT-4等をガイドに使ったcausal discoveryパイプラインの一部として機能する研究例がある。
まだできないこと
実データでの厳密な因果効果の推定・交絡変数の特定・操作変数の妥当性検証など、統計的因果推論の中核作業は専門家の水準に届かない。『The Illusion of Causality in LLMs』(2026)は、LLMの見かけ上の因果推論力が訓練データに強く依存した意味的パターン想起にすぎず、構造感応的な推論ではないと指摘。
なぜそうなのか
因果推論は観測データだけでなく、実験計画・ドメイン知識に基づく識別戦略が必要であり、LLMは相関パターンの学習に最適化されているため、真の因果構造を汎化的に扱えない。データセットが大きくなるほど精度が落ちるとの報告もある。
これからの予測の根拠
因果推論特化のポストトレーニング手法(ICLR2026等)が研究段階にあり、ツール連携(因果推論ライブラリの自動呼び出し)が進めば2027-28年に補助レベルから実務品質(要確認)へ向上する可能性はあるが、専門家超えの見込みは薄い。
いま使える主な道具
GPT-5.x + causal discovery libraries、Claude Fable 5.1、DoWhy/EconML(人間主導)
根拠
- The Illusion of Causality in LLMs: A Developmentally Grounded Analysis 2026-03
LLMの因果推論の見かけの強さは意味的パターン想起であり構造感応的でないと分析 - Can LLMs Serve as Causal Inference Agents? A Study on Post-Training Methods 2026
ICLR2026、post-trainingしても精密な因果推定能力は限定的と報告 - Causal Inference with Large Language Model: A Survey 2024-09
LLM単体は最先端の因果学習手法に及ばず、データ規模が大きいほど性能が落ちると指摘
同じ分野のほかの仕事(データ分析・統計)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。