AIエージェント能力アトラス › 仕事ごとの一覧 › 基盤能力(横断) › マルチモーダル理解(画像/動画/音声/空間)

空間・3D推論

Spatial and 3D reasoning

2/52026年: 補助
2030年(予測): 4/5 専門家並み
02022
12023
12024
22025
22026
32027予
32028予
42030予

0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。

専門家と比べて

建築士やロボット工学者が持つ3次元空間把握には遠く及ばず、単純な相対位置関係の推論すら不安定

できること

自己中心視点(カメラ視点)からの空間関係推論はある程度機能する

まだできないこと

他者視点への変換(allocentric、『相手から見てどちらが左か』)への一般化が弱く、複数視点にまたがるロボット操作向けベンチマークで人間性能を大きく下回る

なぜそうなのか

VLMの訓練データは2D画像の記述が中心で、3次元的な視点変換の教師信号が乏しい

これからの予測の根拠

ロボティクス向け空間データセットの拡充により2028年ごろ改善が見込まれるが、人間水準到達は2030年以降との見方が強い

いま使える主な道具

Gemini 3.1、Claude vision、SpatialVLM系研究

根拠

アトラス全体の地図をひらく →

同じ分野のほかの仕事(マルチモーダル理解(画像/動画/音声/空間))

AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。