AIエージェント能力アトラス › 仕事ごとの一覧 › 基盤能力(横断) › マルチモーダル理解(画像/動画/音声/空間)
動画の時系列理解
Video temporal understanding
2/52026年: 補助
2030年(予測): 4/5 専門家並み
2030年(予測): 4/5 専門家並み
02022
02023
12024
22025
22026
32027予
32028予
42030予
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
映像編集者やスポーツアナリストが行う『時間軸をまたいだ出来事の追跡』には及ばない
できること
短い動画の内容要約、単発シーンの説明は実務品質に近づいている
まだできないこと
長時間動画での出来事の時系列追跡や、特定の時空間領域への根拠づけ(グラウンディング)は依然脆く、新ベンチマークで課題が可視化されている
なぜそうなのか
動画LLMは離散フレームサンプリングに依存することが多く、連続的な時間変化の内部表現が弱い
これからの予測の根拠
動画ネイティブな事前学習(フレーム間の時間的一貫性を直接学習)の拡大で2028年に実務品質化が期待される
いま使える主な道具
Gemini 3.1 video、V-STaRベンチマークモデル群
根拠
- V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning 2026
CVPR2026、時空間手がかりの統合能力を評価するベンチマーク
同じ分野のほかの仕事(マルチモーダル理解(画像/動画/音声/空間))
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。