论文
AgentCVR:通过脚本模拟强化学习进行主动多智能体跨视频推理
AgentCVR: Active Multi-Agent Cross-Video Reasoning via Script-Simulated Reinforcement Learning
摘要
跨视频推理 (CVR) 已成为多模态智能的关键前沿,需要模型检索、对齐和聚合分布在多个视频中的证据。当前的多模态 大语言模型 (MLLM) 常常难以应对 CVR,因为简单的单通道策略将多个视频编码到共享的压缩上下文中,可能会掩盖罕见但关键的证据。在本文中,我们提出了 AgentCVR,这是一种将 CVR 视为主动证据获取任务的多智能体框架。 AgentCVR 采用主代理来迭代协调专门的视觉和音频代理,以进行有针对性的证据提取。为了确保高效的训练,我们引入了脚本模拟强化学习,它使用 LLM 生成的语义脚本和基于文本的轻量级模拟器来优化代理的策略,从而绕过在线探索期间昂贵的多模态推理。综合 CVR 基准测试的实验结果表明,AgentCVR 的性能优于单通道基线,并实现了与最先进的闭源系统相当的性能,特别是在复杂的跨视频对齐和定位方面。为了确保可重复性,我们的代码可从 https://github.com/wang-jh24/AgentCVR 获取。