论文

从意图到证据:策略引导的长视频代理多策略检索

From Intent to Evidence: Policy-Steered Multi-Strategy Retrieval for Long-Video Agents

智能体系统Agent 架构与控制循环

摘要

现有的长视频智能体通过一种统一的行为来获取证据,而忽略了所需证据是否集中、是否需要广泛的事件覆盖范围,或者是否必须区分相互竞争的假设——这可能会在实质性推理开始之前导致失败。为每个问题指定细粒度的解决程序并不是令人满意的补救措施,因为它限制了自主探索。我们提出 VESTA,一个 无需训练 长视频代理,组织为路由条件获取-验证-巩固循环。在探索之前,意图路由器会推断证据获取策略(在共享视觉语音场景索引上进行聚焦、回忆或对比检索)以及配置探索期间维护的证据视图的证据会计策略。策略引导的检索产生临时参考,多模态证据操作将其转换为观察结果,而 Reasoner 仍然可以自由地验证它们、使用中间结果重新查询或检查检索集之外的区域。时间证据分类账将观察结果整合为时间位置、出处、覆盖范围、冲突、验证结果和假设支持的自适应压缩视图,暴露丢失和未解决的证据以指导后续获取;最终确定优先考虑经过验证的观察结果。在 Video-MME-v2 上,VESTA 的平均准确度比 VideoARM 提高了 2.7 个百分点,并且在所有六个报告指标上都有所提高。在共享查询时间模型下的 LongVideoBench、EgoSchema 和 LVBench 上,它在 LongVideoBench 长子集上提高了 6.9 点,在 LVBench 上提高了 1.5 点,并且与 EgoSchema 上的 VideoARM 相匹配。