AIエージェント能力アトラス › 仕事ごとの一覧 › コンテンツ制作 › 動画生成
長尺・複数シーンでの一貫性維持
Maintain consistency across long-form, multi-scene video
2/52026年: 補助
2030年(予測): 4/5 専門家並み
2030年(予測): 4/5 専門家並み
02022
02023
12024
12025
22026
32027予
42028予
42030予
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
Kling 3.0で1回生成あたり最大3分まで伸びたが、90秒を超える連続クローズアップでアーティファクト検出率が顕著に上昇すると報告
できること
数十秒〜数分の単発生成、Klingでの90秒程度までの実用的なマルチショット継続
まだできないこと
数分規模の一貫したワンカット長編、90秒超の顔クローズアップでの破綻回避
なぜそうなのか
時間的一貫性(temporal consistency)の維持がモデルの根本的な未解決課題として残っている
これからの予測の根拠
生成可能尺が15秒(Sora2)→3分(Kling3.0)へ急伸している実績から2028年に長尺一貫性が実務品質へ近づくと予測
いま使える主な道具
Kling 3.0、Veo 3.1、Runway Gen-4
根拠
- AI Video Limitations in 2026: What Still Fails 2026
90秒を超える連続クローズアップでアーティファクト検出率が顕著に上昇すると分析 - LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation 2026
長尺・複雑テキスト動画生成の評価ベンチマーク論文
同じ分野のほかの仕事(動画生成)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。