AIエージェント能力アトラス › 仕事ごとの一覧 › 研究・問題解決 › 社会科学・経済・政策分析
経済予測・計量経済分析
Economic Forecasting & Econometric Analysis
2030年(予測): 4/5 専門家並み
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
GPT-4.5級LLMの一般予測タスクでのBrierスコアは0.101、スーパーフォーキャスター群は0.081まで接近し、Forecasting Research Instituteは2026年11月中央値でパリティ到達と予測するが、経済予測特化タスクでは専門家群0.0225 vs o3=0.1352と依然大差があり、かつ全モデルでマクロ経済のin-sample予測に先読みバイアス(lookahead bias)が検出されている。
できること
ニュース・決算コールなど非構造化テキストを処理してGDPナウキャストの精度を高める、一般人の平均を上回る予測、人間とのハイブリッドで24-28%の精度向上(GPT-4-Turbo支援時)。
まだできないこと
経済予測に特化したプロ予測者集団・スーパーフォーキャスター集団を安定して上回れない。学習データ汚染によるin-sample予測での先読みバイアスを回避できず、正確な過去の数値データの想起が弱い。
なぜそうなのか
学習データにテスト期間後の情報が混入しバックテストが汚染される。情報の提示形式に予測精度が強く依存する脆弱性がある。
これからの予測の根拠
一般予測タスクでは2026年内にスーパーフォーキャスター並みに近づく統計的トレンドがあるが、経済特化タスクは先読みバイアス問題の解消(データセット再設計)が必要でラグが生じ、2028年頃に専門家並みへ到達すると予測。
いま使える主な道具
GPT-5.x、Claude Fable 5.1、Gemini 3、ChatMacro (SF Fed evaluation)
根拠
- Fake Date Tests: Can We Trust In-sample Accuracy of LLMs in Macroeconomic Forecasting? 2026-01
全モデルがin-sampleマクロ予測での先読みバイアステストに不合格 - AI Forecasting in 2026: What 11 Analyses Say 2026
LLM-スーパーフォーキャスターのパリティ到達時期を線形外挿で2026年11月中央値と推定 - Evaluating LLMs on Real-World Forecasting Against Expert Forecasters 2026
専門家群Brier0.0225 vs o3=0.1352という大差を報告
同じ分野のほかの仕事(社会科学・経済・政策分析)
- 政策シミュレーション・エージェントベースモデリング
- 社会調査・世論調査の被験者代理(シリコンサンプリング)
- 言説分析・世論分析(政治テキストの大規模アノテーション)
- 歴史・人文学研究支援
- 政策提言・報告書のエビデンス統合
- 因果推論・政策効果測定(プログラム評価)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。