论文

面向多跳音视频推理的智能体式主动全模态感知

Agentic Active Omni-Modal Perception for Multi-Hop Audio-Visual Reasoning

智能体系统上下文与知识记忆Agent 架构与控制循环Agent记忆

摘要

多跳音视频推理对全模态大模型(Omni-LLM)仍然具有挑战性,因为相关证据往往稀疏、在时间上分散,且分布于音频与视觉两条流之中。现有基准对这一设定的考察有限,通常只涉及少量模态、相关时间段或推理步骤。在本工作中,我们提出MOV-Bench,一个包含519道精心筛选问题的基准,这些问题需要对时间上分散的音视频证据进行多跳推理。在MOV-Bench上的评估揭示,当前的全模态大模型在多跳跨模态推理上仍然吃力。为应对这一挑战,我们进一步提出AOP-Agent,一个构建于开源全模态大模型之上、面向主动全模态感知的高效智能体框架。通过将分层全模态记忆与协作式的观察-反思-重规划循环相结合,AOP-Agent使开源全模态大模型无需额外训练或专有模型即可执行主动感知。在MOV-Bench和OmniVideoBench上的实验表明,AOP-Agent持续提升推理性能,在长视频和推理密集型问题上增益尤为显著。

面向多跳音视频推理的智能体式主动全模态感知:论文配图
图 1:MOV-Bench 的代表性示例,说明视频中的视听多跳推理。该问题需要将时间上分离的视觉证据(识别应用于芯片的化合物)与描述坏芯片和散热器接触的音频证据联系起来。只有通过跨时间联合对齐这些稀疏的视听线索才能获得正确的答案。