论文
AVA-Encoder:迈向代理原生视频表示学习
AVA-Encoder: Towards Agent-Native Video Representation Learning
摘要
视频创意人员仍然缺乏从高质量人类电影中学习的有效方法,限制了他们制作电影级视频的能力。一个关键的挑战是缺乏既忠实于电影内容又可直接用于代理推理和操作的结构化视频表示。为了应对这一挑战,我们提出了代理视频自动编码器(AVA-Encoder),这是一种由代理自我进化驱动的新颖的自动编码框架,用于学习代理本机视频表示。 AVA-Encoder 将视频转换为电影知识图 (KG) 表示形式,然后将其重建回视频。这种 Film KG 表示形式以结构化形式明确捕获实体、事件、资产及其多模式关系,使代理可以轻松理解、查询和操作。重建残差驱动双循环文本梯度优化框架,共同改进 Film KG 表示和 Agentic 视频编码器。大量实验表明,AVA-Encoder 比最强的外部基线实现了 20.7 个百分点的绝对增益,或 73.1% 的相对改进。在仅受控策略设置中,其伪训练 Agentic Video Encoder 策略也优于精心人工调整的策略,同时使用的镜头级别减少了 74.3%,关键帧级别系统提示词元减少了 70.1%。我们发布了完整的 AVA-Encoder 框架、可靠的代理视频重建基准,以及第一个高质量 Film KG 表示的数据集。