论文

总结、判断、提炼:多模式内容审核的解耦内容理解和策略学习

Summarize, Judge, Refine: Decoupled Content Understanding and Policy Learning for Multimodal Content Moderation

模型训练强化学习

摘要

传统上,内容审核系统将多模态理解与特定于政策的分类纠缠在一起,需要针对每个政策变化进行完整的流程再训练,并且由于无法有意义地增强多媒体而遭受标签稀缺的困扰。我们提出了 Summarize-Judge-Refine (SJR),这是一种双模型架构,可通过自然语言界面解耦这些问题:多模式内容模型生成结构化文本摘要,纯文本策略模型根据策略定义对它们进行分类。迭代协同训练循环通过 GRPO 完善内容模型,以生成与策略相关的摘要,而文本空间增强则生成对抗性摘要变体(原始多媒体上不可能实现的增强路径),从而实现少量策略引导。每个决策都基于人类可读的摘要,作为结构副产品提供可解释性。在误导性广告检测方面,SJR 在零样本思想链基线上实现了 +23.6% 的相对非误导性 F1,优于端到端 SFT、STaR/RFT 和 RLFT。值得注意的是,在零真实违规示例上训练的变体(综合生成所有正类数据)与违规 F1 的相对误差在 0.2% 以内,这表明新策略可以在没有任何真实违规数据的情况下启动。