论文
LAVE:视频工具使用代理的潜在视觉证据增强规划
LAVE: Latent Visual Evidence-Enhanced Planning for Video Tool-use Agents
摘要
长视频理解需要模型从长且冗余的视频流中有效地获取和重用稀疏的视觉证据。最近的视频工具使用代理通过在不同时间尺度迭代调用视觉工具来解决这一挑战,但他们的工具规划器通信通常依赖于文本观察。这种纯文本界面提供了工具计算的有损摘要,导致先前计算的未用语言表达的视觉证据被丢弃并且无法用于后续规划。我们将此限制确定为工具观察瓶颈,并提出潜在视觉证据增强规划(LAVE),这是一个 无需训练 框架,用于重用已完成的工具调用中的潜在视觉证据。 LAVE 引入了双通道观察界面:可见通道保留原始文本轨迹,而潜在通道则存储语言前的视觉更新及其工具角色、源帧时间戳和视觉位置。在规划期间,LAVE 检索与当前 Planner 状态相关但未被文本观察覆盖的证据,并通过有界时间戳对齐的潜在更新与熵约束的帧时间路由将其集成。这使得视频代理能够重用现有的视觉计算,而无需额外的训练、帧重播或对原始编排的修改。在 Video-MME、LongVideoBench 和 CG-Bench 上进行的大量实验表明,LAVE 持续改进了跨主干网的视频工具使用代理。在可比较的帧预算下,LAVE 将视频-MME 总体得分比最强基线提高了 3.76 分,证明了潜在视觉证据重用对于多步骤视频代理规划的有效性。