论文

CaC:通过分层时空集中推进视频奖励模型

CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating

模型训练奖励建模与过程监督

摘要

在本文中,我们提出了集中和集中(CaC),一种基于视觉语言模型的从粗到细的异常奖励模型。在推理过程中,它首先进行全局时间扫描以锚定异常时间窗口,然后在局部区间内进行细粒度的空间空间定位,最后通过结构化时空思维链推理得出稳健的判断。为了使模型具备这些功能,我们构建了第一个大规模生成的视频异常数据集,其中包含每帧边界框注释、时间异常窗口和细粒度归因标签。在此数据集的基础上,我们设计了一个三阶段渐进训练范例。该模型最初通过单帧和多帧监督 微调 学习空间和时间锚定,然后通过基于两轮组相对策略优化(GRPO)的强化学习策略进行优化。除了传统的准确性奖励之外,我们还引入了时间和空间 IoU 奖励来监督中间定位过程,有效引导模型进行更基础和可解释的时空推理。大量实验表明,CaC 可以稳定地专注于细微异常,在细粒度异常基准上实现 25.7% 的准确度提升,并且当用作奖励信号时,CaC 将生成的视频异常减少 11.7%,同时提高整体视频质量。