论文
面向多跳音视频推理的智能体式主动全模态感知
Agentic Active Omni-Modal Perception for Multi-Hop Audio-Visual Reasoning
摘要
多跳音视频推理对全模态大模型(Omni-LLM)仍然具有挑战性,因为相关证据往往稀疏、在时间上分散,且分布于音频与视觉两条流之中。现有基准对这一设定的考察有限,通常只涉及少量模态、相关时间段或推理步骤。在本工作中,我们提出MOV-Bench,一个包含519道精心筛选问题的基准,这些问题需要对时间上分散的音视频证据进行多跳推理。在MOV-Bench上的评估揭示,当前的全模态大模型在多跳跨模态推理上仍然吃力。为应对这一挑战,我们进一步提出AOP-Agent,一个构建于开源全模态大模型之上、面向主动全模态感知的高效智能体框架。通过将分层全模态记忆与协作式的观察-反思-重规划循环相结合,AOP-Agent使开源全模态大模型无需额外训练或专有模型即可执行主动感知。在MOV-Bench和OmniVideoBench上的实验表明,AOP-Agent持续提升推理性能,在长视频和推理密集型问题上增益尤为显著。
