论文

以树形式搜索视频:用于有证据定位的长视频问答 的自校正代理

Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA

智能体系统Agent 规划

摘要

扎根长视频问答(Grounded LVQA)需要回答有关长视频的问题,同时定位支持答案的短证据区间。最近的代理方法将此任务框架为具有单个crop_video(start, end)动作的多轮探索,它支持从粗到细的缩小,但不提供从细到粗回溯的原语。因此,这些智能体通常会过早收敛,并且无法从早期错误中恢复。我们提出了 VideoTreeSearch (VTS),这是一个将基于 LVQA 的框架作为自适应时间树上的迭代自校正搜索的框架。 VTS 从视觉场景边界构建非均匀树,以便每个节点对应于语义连贯的片段,并训练代理通过四个离散操作来导航树:zoom_in、zoom_out、shift 和 answer。这些操作将回溯和恢复公开为显式的、可学习的原语,而不是隐式的行为。为了训练这种导航,我们引入了一个轨迹合成管道,它可以在树中生成多步路径,包括故意绕道进入不正确的分支,然后进行恢复。我们将这些轨迹用于监督 微调,然后进行具有基础和答案准确性奖励的强化学习。在三个 Grounded LVQA 基准测试(CG-Bench、Haystack-LVBench、Haystack-Ego4D)上,VTS 在 CG-Bench 上的表现优于最强的先验代理方法,在 CG-Bench 上表现出+12.5 mIoU,在 Haystack-Ego4D 上表现出+7.4 T-F1。学习到的策略还可以转移到一般的长视频 QA,超过了 Video-MME、MLVU 和 LVBench 上所有先前的代理基线,准确度高达 +7.1 个点。消融证实,自我修正的分层搜索是这些收益背后的核心机制:删除自适应下降或显式回溯会大大降低性能。代码可在 https://github.com/CeeZh/VTS 获取。