论文

VAMR:多问题 Agentic 推理以实现高效的长格式视频理解

VAMR: Multi-Question Agentic Reasoning for Efficient Long-Form Video Understanding

智能体系统模型训练上下文与知识强化学习记忆Agent 架构与控制循环

摘要

长视频理解通常涉及有关同一录音的不同方面的多个问题。然而,现有的视频代理通常通过孤立的工具使用轨迹来处理每个问题。这会反复重新启动视频探索和记忆构建,从而错过了共同获取证据并逐步建立支持完整问题集的共同理解的机会。我们引入了 \textbf{VAMR} (\textbf{V}ideo \textbf{A}gent for \textbf{M}ulti-Question \textbf{R}easoning),它通过一个共享的工具使用轨迹协调有关视频的所有问题。在每一轮中,持久性政策模型都可以针对一个或多个未解决的问题调用工具,并提交有足够证据的问题的答案。问题条件视觉感知在一次通话中检索多个问题的细粒度线索,而分层多问题记忆将可重复使用的上下文集成到共享视频故事中,并为各个问题保留单独的证据。在有监督的微调初始化这个交互协议之后,我们提出 问题范围策略优化(\qhpo),用于优化问题在不同轮次中进展和结束的共享轨迹。具体来说,问题级评论家估计每个活动问题的价值,而轮次对齐将每个问题优势映射到直接为其服务的轮次,然后聚合对齐的优势以优化共享参与者。在 LVBench、Video-Holmes 和 LongVideoBench 中,VAMR 在迭代方法中实现了最高的总体精度和最少的推理轮次。在 LVBench 上,它的准确率达到 62.1\%,超过 VideoARM \textbf{4.3} 点,同时减少了 \textbf{85.9\%} 和 \textbf{61.4\%} 的推理轮数和处理帧数。