论文
学习观看:通过交错策略优化主动理解视频异常
Learning to Watch: Active Video Anomaly Understanding via Interleaved Policy Optimization
摘要
视频异常理解 (VAU) 依赖于稀疏的、上下文相关的线索。然而,现有的被动范例受到观察混叠的影响,其中静态采样无法消除语义上不同的事件的歧义。为了克服这个问题,我们提出了 $Anom\text{-}π$,这是一个闭环框架,它将视频理解重新概念化为动态环境中的主动顺序决策过程。受人类视频审查行为的启发,该框架将内部认知推理和战略证据获取统一为交错策略,利用局部回溯、时间扩展和细粒度采样等时间原子算子赋予模型感知主动性。为了在视频级弱监督下学习这种复杂的交互策略,我们设计了交互式直接偏好优化(iDPO)来实现轨迹级策略调整,并以主动证据查询(AEI)实用程序为指导,平衡任务成功、信息证据获取和交互成本。这种方法使智能体能够学习主动消除假设的歧义,同时抑制冗余探索。大量的实验表明,我们的框架仅用 2B 个参数就实现了极具竞争力的性能,在复杂场景下显着优于最先进的大规模 VAU 模型。