AIエージェント能力アトラス › 仕事ごとの一覧 › 物理世界・ロボット › 身体性を伴うAI基盤モデル(VLA)
汎用ピック&プレース(未見物体)
Generalist pick-and-place on unseen objects
2030年(予測): 5/5 専門家超え
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
GR00T N1-2Bは実機ヒューマノイドタスクで平均成功率76.8%、OpenVLAは未見ピック&プレースで73%、RT-2(55Bパラメータ)は未見物体で62%。訓練済みタスクに限れば非熟練作業者に近い水準だが、多様な物体・配置への安定性はまだ専門家(熟練作業者)に届かない
できること
訓練分布に近い物体・環境での高精度なピック&プレース、少量データでの一定の汎化(GR00T N1はデータの10%のみで42.6%達成)
まだできないこと
訓練分布から大きく外れた物体形状・材質・配置での安定動作
なぜそうなのか
Open X-Embodiment等の実世界ロボットデータセットはテキストデータに比べ桁違いに少なく、多様性も限定的なため
これからの予測の根拠
GR00T N2のような世界行動モデル(world action model)アーキテクチャが既存VLA比2倍の成功率向上を示しており、2028年に専門家並みへ到達すると推定
いま使える主な道具
NVIDIA GR00T N1/N2、Google Gemini Robotics-ER 2、Physical Intelligence π0.5、OpenVLA
根拠
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots 2026
実機GR-1タスクで平均成功率76.8%、10%データで42.6% - OpenVLA vs RT-2 benchmark comparison 2026
OpenVLA未見タスク73% vs RT-2(55B) 62% - GR00T N2 next-generation robot foundation model 2026
既存VLA比2倍以上の新環境成功率、RoboArena等で1位
同じ分野のほかの仕事(身体性を伴うAI基盤モデル(VLA))
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。