论文
LensWalk:通过规划您在视频中的观看方式来实现代理视频理解
LensWalk: Agentic Video Understanding by Planning How You See in Videos
摘要
视频的密集性、时间性对自动化分析提出了严峻的挑战。尽管使用了强大的视觉语言模型,但流行的视频理解方法受到推理和感知之间固有的脱节的限制:它们依赖于静态的、预处理的信息,并且随着理解的发展,无法主动从视频中寻找原始证据。为了解决这个问题,我们引入了 LensWalk,这是一个灵活的代理框架,使 大语言模型 推理机能够主动控制自己的视觉观察。 LensWalk 建立了一个紧密的原因-计划-观察循环,其中代理在每一步动态指定其观察的视频的时间范围和采样密度。使用一套由这些规范参数化的基于视觉语言模型的多功能工具,代理可以执行广泛的线索扫描,专注于事实提取的特定部分,并从多个时刻缝合证据以进行整体验证。这种设计允许渐进的、按需的证据收集,直接服务于智能体不断发展的思维链。无需任何模型 微调,LensWalk 即可在多个模型配方上实现可观的即插即用性能提升,在 LVBench 和 Video-MME 等具有挑战性的长视频基准测试中将其准确性提高 5% 以上。我们的分析表明,让代理能够控制它的观看方式是解锁更准确、稳健和可解释的视频推理的关键。