论文
原生主动感知作为全模态理解的推理
Native Active Perception as Reasoning for Omni-Modal Understanding
摘要
用于长视频理解的被动模型通常依赖于“全部观看”范例,无论查询难度如何,都统一处理帧,导致计算成本随着视频持续时间的增长而增加。尽管交互式框架已经出现,但它们通常依赖于全局预扫描,并且它们的上下文成本仍然随着视频长度而变化。我们提出了 OmniAgent,这是第一个原生全模态代理,它将视频理解制定为基于 POMDP 的迭代观察-思考-行动循环。 OmniAgent 执行按需操作,有选择地将视听线索提取到持久的文本内存中,从而有效地将推理复杂性与原始视频持续时间解耦。为了实现这一点,我们引入了(1)代理监督微调,通过具有双阶段质量控制的N最佳轨迹合成来引导原生主动感知,以及(2)使用TAURA(回合感知自适应不确定性重新调整优势)的代理强化学习,它利用回合级熵来引导贡献分配转向关键发现回合。至关重要的是,OmniAgent 表现出积极的测试时间扩展,其中性能随着推理轮数的增加而提高,从而验证了主动感知的有效性。十个基准测试(例如 VideoMME、LVBench)的实证结果表明,OmniAgent 在开源模型中实现了最先进的性能。值得注意的是,在 LVBench 上,我们的 7B 代理的性能优于大 10倍的 Qwen2.5-VL-72B(50.5% vs. 47.3%)。