AIエージェント能力アトラス › 仕事ごとの一覧 › 研究・問題解決 › データ分析・統計
機械学習パイプライン自動構築(AutoML/Kaggle型)
AutoML / End-to-End ML Pipeline Construction
2030年(予測): 5/5 専門家超え
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
MLE-benchでのメダル率はR&D-Agentで35.1%(オープンソースSOTA)、FM Agentは有効な提出率96.89%と報告されており、『動くパイプラインを完走する』点では実務品質に達しつつあるが、金・銀メダル相当の独創的モデリングは専門家に劣る。
できること
Kaggle形式のコンペで前処理・特徴量エンジニアリング・モデル選択・アンサンブルまで一気通貫で自律実行し、有効な提出を高確率で生成できる。
まだできないこと
トップ入賞レベルの独創的な特徴量設計やドメイン特化のモデリング工夫は依然人間の専門家に及ばず、長時間・多段の意思決定が絡むタスクでは失敗率が上がる(LongDS-Bench)。
なぜそうなのか
コンペ上位解法は暗黙知・試行錯誤の蓄積に基づく創造的仮説生成に依存する部分が大きく、LLMエージェントは既知の手法の組み合わせ最適化は得意でも、真に新規な仮説空間の探索は限定的。
これからの予測の根拠
MLE-benchのメダル率が年々上昇しているトレンドから、2028年までに大半のコンペでミドルエンジニア相当に達すると見込まれるが、トップ入賞の独創性は専門家超えに届きにくい。
いま使える主な道具
R&D-Agent、FM Agent、AutoMind、AutoGluon+LLM orchestration
根拠
- MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering 2024-10
75件のKaggleコンペでML自律エージェントを評価するベンチマークを提示 - The FM Agent 2025-10
有効提出率96.89%を達成 - LongDS-Bench: On the Failure of Long-Horizon Agentic Data Analysis 2026-05
長時間・多段データ分析タスクでの失敗モードを分析
同じ分野のほかの仕事(データ分析・統計)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。