论文

CARO:面向稳健内容审核的类比链推理优化

CARO: Chain-of-Analogy Reasoning Optimization for Robust Content Moderation

模型训练偏好优化

摘要

当前的大语言模型(LLM),即使是显式为推理训练的模型,也常常因上下文中嵌入的误导性“决策捷径”而在模糊的内容审核案例上表现吃力。受认知心理学对专家审核洞见的启发,我们提出CARO(类比链推理优化),一个在LLM中诱导稳健类比推理的两阶段训练框架。首先,CARO通过在审核数据上的检索增强生成(RAG)引导构建类比推理链,并进行监督微调(SFT)。其次,我们提出一种定制的直接偏好优化(DPO)方法,显式强化类比推理行为。与静态检索方法不同,CARO在推理时动态生成量身定制的类比参照,有效缓解有害的决策捷径。大量实验表明,CARO显著优于最先进的推理模型(DeepSeek R1、QwQ)、专门的审核模型(LLaMA Guard)以及先进的微调和检索增强方法,在具有挑战性的模糊审核基准上平均F1提升24.9%。

CARO:面向稳健内容审核的类比链推理优化:论文配图
图1:在真实无害样本上对比标准推理与类比推理范式,展示两种范式在内容审核判断上的差异。