论文
视频异常推理的语言相对策略优化
Linguistic Relative Policy Optimization for Video Anomaly Reasoning
摘要
采用多模态 大语言模型 的视频异常检测(VAD)已显示出强大的潜力,但大多数现有方法仍然依赖于大规模注释或专家设计的先验,限制了它们在尽可能少的人工干预下获取异常知识的能力。为了解决这个问题,我们提出了语言相对策略优化(LRPO),它将来自多个推理轨迹的组相对语义优势提炼成语言表达的异常经验先验,并通过将先验注入到上下文中来调整模型,以在没有任何参数更新的情况下引导其输出分布。 LRPO 构建了两种互补的体验表示:一般体验捕获跨场景的可转移异常偏好,而场景体验则对上下文相关的异常规则进行建模以进行有针对性的细化。为了进一步改善学习体验,我们引入了异常对齐奖励,指导轨迹优化以匹配人类风险偏好并强化基于时间的推理。对 XD-Violence、UCF-Crime 和 UBnormal 的大量实验表明,在免调优设置下,LRPO 显着优于现有的最先进方法。