AIエージェント能力アトラス › 仕事ごとの一覧 › 基盤能力(横断) › マルチモーダル理解(画像/動画/音声/空間)
空間・3D推論
Spatial and 3D reasoning
2/52026年: 補助
2030年(予測): 4/5 専門家並み
2030年(予測): 4/5 専門家並み
02022
12023
12024
22025
22026
32027予
32028予
42030予
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
建築士やロボット工学者が持つ3次元空間把握には遠く及ばず、単純な相対位置関係の推論すら不安定
できること
自己中心視点(カメラ視点)からの空間関係推論はある程度機能する
まだできないこと
他者視点への変換(allocentric、『相手から見てどちらが左か』)への一般化が弱く、複数視点にまたがるロボット操作向けベンチマークで人間性能を大きく下回る
なぜそうなのか
VLMの訓練データは2D画像の記述が中心で、3次元的な視点変換の教師信号が乏しい
これからの予測の根拠
ロボティクス向け空間データセットの拡充により2028年ごろ改善が見込まれるが、人間水準到達は2030年以降との見方が強い
いま使える主な道具
Gemini 3.1、Claude vision、SpatialVLM系研究
根拠
- Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes 2025-10
多視点ロボットシーンでの空間推論ベンチマークMV-RoboBenchを提案
同じ分野のほかの仕事(マルチモーダル理解(画像/動画/音声/空間))
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。