AIエージェント能力アトラス › 仕事ごとの一覧 › 基盤能力(横断) › マルチモーダル理解(画像/動画/音声/空間)

動画の時系列理解

Video temporal understanding

2/52026年: 補助
2030年(予測): 4/5 専門家並み
02022
02023
12024
22025
22026
32027予
32028予
42030予

0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。

専門家と比べて

映像編集者やスポーツアナリストが行う『時間軸をまたいだ出来事の追跡』には及ばない

できること

短い動画の内容要約、単発シーンの説明は実務品質に近づいている

まだできないこと

長時間動画での出来事の時系列追跡や、特定の時空間領域への根拠づけ(グラウンディング)は依然脆く、新ベンチマークで課題が可視化されている

なぜそうなのか

動画LLMは離散フレームサンプリングに依存することが多く、連続的な時間変化の内部表現が弱い

これからの予測の根拠

動画ネイティブな事前学習(フレーム間の時間的一貫性を直接学習)の拡大で2028年に実務品質化が期待される

いま使える主な道具

Gemini 3.1 video、V-STaRベンチマークモデル群

根拠

アトラス全体の地図をひらく →

同じ分野のほかの仕事(マルチモーダル理解(画像/動画/音声/空間))

AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。