论文
用于异常视频理解的测试时强化学习
Test-time Reinforcement Learning for Anomalous Video Understanding
摘要
异常视频理解旨在识别视频中的异常事件并解释其语义,而不仅仅是简单的异常检测。最近的视频大语言模型(Video-LLM)已经证明了该任务的零样本能力,但由于对不同异常模式和不断变化的环境的适应不足,其性能仍然有限。测试时强化学习提供了一种有前途的解决方案,使模型能够通过自我生成的反馈信号进行改进,而无需额外的人工注释。然而,由于三个问题,将其应用于异常视频理解仍然具有挑战性:(1)当共识较弱时,生成的伪标签可能不可靠; (2)二元奖励设计未能捕捉模型生成中的不确定性,导致优化信号无效; (3)结果完全一致的采样轨迹的群体获得相同的奖励,导致群体相对优势崩溃并消除有效的政策梯度信号。为了应对这些挑战,我们通过引入双查询一致性过滤、熵感知共识奖励和虚拟负锚机制,提出了一种用于异常视频理解的新颖的测试时强化学习框架。该框架通过语义等效查询的一致性保留可靠的样本,将答案一致性与奖励估计的生成不确定性相结合,并引入虚拟负锚以在结果完全一致的采样轨迹组中创建奖励变化,从而保留有效的组相关优化信号。 VAU-Bench 上的实验表明,我们的方法优于冷冻基线和监督基线。收益在带有思考的 VAU-Bench 的 ECVA 子集上最为明显,相对于冻结主干网,其准确度从 75.81% 提高到 90.00%。