论文

通过自适应 Tversky 策略优化的可控多标签视频安全检测

Controllable Multi-label Video Safety Detection via Adaptive Tversky Policy Optimization

模型训练强化学习

摘要

基于视频的社交媒体的快速增长增加了用户接触有害内容的机会,从而产生了对可靠的自动视频安全检测的需求。尽管最近的视觉语言模型(VLM)显示出强大的视频理解能力,但现有的有害视频检测系统面临两个关键限制:它们通常将安全检测简化为二元分类,忽略了不安全视频固有的多标签性质;它们依赖于不支持可控精确召回权衡的静态训练目标,尽管所需的操作点可能因审核管道和不安全类别而异。为了解决这些差距,我们提出了自适应 Tversky 策略优化(ATPO),这是一种用于多标签视频安全检测(Multi-VSD)的强化学习框架。 ATPO 引入了自适应 Tversky 奖励(ATR),它在训练过程中动态调整假阳性和假阴性惩罚,以实现可控的精确召回权衡。 SafeWatch-Bench 和 XD-Violence 上的实验表明,ATPO 显着提高了多标签性能,将 SafeWatch-Bench-Real 上的 Jaccard 指数从 40.66 提高到 75.44。此外,ATR 能够可靠地控制精确召回操作点,支持具有异构策略要求的部署场景。代码和检查点在 https://bruceyg.github.io/ATPO-project-page/ 中提供。