论文
VideoSEAL:通过解耦答案权威来减轻代理长视频理解中的证据错位
VideoSEAL: Mitigating Evidence Misalignment in Agentic Long Video Understanding by Decoupling Answer Authority
摘要
长视频问答需要在高度冗余的内容中定位稀疏、时间分散的视觉证据。尽管当前的 MLLM 在短视频上表现良好,但长视频引入了长视野搜索和验证,这通常需要多轮、代理交互。我们表明,现有的 LVU 智能体可能会表现出“证据错位”:它们产生的正确答案不受检索或检查的证据的支持。为了描述这种失败的特征,我们引入了两种诊断(时间基础和语义基础),并用它们来揭示两种放大偏差的压力:推理时共享上下文饱和带来的提示压力和训练期间仅结果优化带来的奖励压力。这些发现指出了结构性根本原因:耦合代理范式将长期规划与答案权威混为一谈。因此,我们提出了解耦的规划器-检查器框架,它将规划与答案权威分开,并控制像素级验证的最终答案。在四个长视频基准测试中,我们的框架提高了答案准确性和证据对齐,在 LVBench 上实现了 55.1%,在 LongVideoBench 上实现了 62.0%,同时生成了可解释的搜索轨迹。此外,解耦架构可随着搜索预算的增加而不断扩展,并支持 MLLM 主干网的即插即用升级,而无需重新训练规划人员。代码和模型可在 https://github.com/Echochef/VideoSEAL 获取。