AIエージェント能力アトラス › 仕事ごとの一覧 › 研究・問題解決 › 社会科学・経済・政策分析
社会調査・世論調査の被験者代理(シリコンサンプリング)
Survey Research & Silicon Sampling
2030年(予測): 3/5 実務品質(要確認)
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
シリコンサンプリングされたGPT-3.5の回答は党派的・人種的な感情的分極の推定値を実際の人間ベンチマークの約7倍に誇張し、LLMによる定性コーディングは難民ステータス・性別・教育水準など回答者属性と系統的に相関する誤りを生むことが示されており、本調査に代替できるレベルには到達していない。
できること
早期コンセプトテストや質問票設計の補助、低コストでのパイロット回答生成、既存調査データの転移・再利用(silicon sampling via cross-survey transfer)。
まだできないこと
実在の(特に周縁化された)人口集団を代表できない。現実的な回答分散を再現できず(分散過小→過信した信頼区間)、政策判断に資する本調査の代替にはならない。ペルソナ条件付けによるステレオタイプの増幅を避けられない。
なぜそうなのか
LLMは実在集団からのサンプルではなく学習データ中のパターンを反映するため、代表性が構造的に欠如する。出力の低分散が統計的な過信を生む。
これからの予測の根拠
モード崩壊補正などの手法は対症療法にとどまり、代表性の構造的欠如という根本問題を解決していないため、2030年まで実質的な停滞(レベル2-3)が続くと予測。
いま使える主な道具
GPT-5.x (persona-conditioned)、Claude Fable 5.1、Semantic Similarity Rating correction methods
根拠
- Not-quite-human tastes: the stylized omnivorousness of LLM survey surrogates 2026-06
LLM代理回答が実際の嗜好パターンを歪めて均質化することを実証 - Synthetic Sample in Social Research: significant limitations of AI generated responses 2026
AI生成回答の社会調査への適用に重大な限界があると報告 - Correcting Mode Collapse in Silicon Sampling with Semantic Similarity Rating 2026-07
モード崩壊(多様性喪失)を補正する手法を提案するも根本解決ではない
同じ分野のほかの仕事(社会科学・経済・政策分析)
- 経済予測・計量経済分析
- 政策シミュレーション・エージェントベースモデリング
- 言説分析・世論分析(政治テキストの大規模アノテーション)
- 歴史・人文学研究支援
- 政策提言・報告書のエビデンス統合
- 因果推論・政策効果測定(プログラム評価)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。