AIエージェント能力アトラス › 仕事ごとの一覧 › 研究・問題解決 › データ分析・統計
統計的検定の妥当な選択
Appropriate Statistical Test Selection
2030年(予測): 4/5 専門家並み
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
標準的な仮説検定シナリオでは主要LLM(ChatGPT/Claude/Gemini/Grok/DeepSeek/Le Chat)は概ね同等の精度で妥当な検定を選択できるが、モデル間で説明品質・統計的推論力に差があり、統計家の厳密なレビューに完全に置き換わる水準ではない。
できること
標準的な研究デザイン(対応あり/なしt検定、カイ二乗、ANOVA、ノンパラ検定等)について、20の定型シナリオを用いた2025年Cureus研究では6モデルとも高い一致率で妥当な検定を選べることが示された。
まだできないこと
非定型・複雑な研究デザイン(多重共線性、階層データ、繰り返し測定の欠測パターンなど)での検定選択の妥当性は未検証領域が大きく、モデルによって統計的概念の説明品質にばらつきがある(ChatGPTは推論説明で最下位という報告も)。
なぜそうなのか
定型的な検定選択は教科書的な決定木としてテキストに大量に存在するためパターンマッチで対応できるが、非定型データ構造の妥当性判断には統計理論の深い体系的理解と多くの反例知識が必要で、LLMの学習分布に薄い。
これからの予測の根拠
検定選択の教科書的知識は既にほぼ飽和しており、今後はモデル間の説明力の均質化と非定型デザインへの対応拡大が主な伸びしろとなる。
いま使える主な道具
ChatGPT、Claude Fable 5.1、Gemini、Grok、DeepSeek、Le Chat
根拠
- Evaluating the Accuracy and Explanatory Quality of Large Language Models ChatGPT, Claude, DeepSeek, Gemini, Grok, and Le Chat in Statistical Test Selection for Hypothesis Testing Decisions 2025-10
6モデルとも検定選択精度は同等だが説明品質にばらつき - Evaluating large language models for selection of statistical test for research: A pilot study 2024
ChatGPT3.5等の検定選択の一致率は77-96%とモデルにより差
同じ分野のほかの仕事(データ分析・統計)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。