论文

禁止:通过不对称辩论进行自定义政策护栏的综合训练

BARRED: Synthetic Training of Custom Policy Guardrails via Asymmetric Debate

模型训练合成数据

摘要

为自定义策略部署护栏仍然具有挑战性,因为通用安全模型无法捕获特定于任务的要求,同时提示 LLM 遭受边界情况性能不一致和高推理成本的困扰。训练自定义分类器可实现准确性和效率,但需要大量标记数据,而获取成本高昂。我们提出了 BARRED(通过反思和辩论进行边界对齐细化),这是一个仅使用任务描述和一小组未标记示例来生成忠实且多样化的合成训练数据的框架。我们的方法将领域空间分解为维度以确保全面覆盖,并采用多智能体辩论来验证标签的正确性,从而产生高保真训练语料库。跨不同自定义策略的实验表明,根据我们的合成数据进行微调的小语言模型始终优于最先进的专有 LLM(包括推理模型)和专用护栏模型。消融研究证实,维度分解和基于辩论的验证对于确保有效 微调 所需的多样性和标签保真度至关重要。 BARRED 框架消除了对大量人工注释的依赖,为准确的定制护栏提供了可扩展的解决方案。