论文
监护人作为顾问:推进下一代监护人模型,打造值得信赖的 LLM
Guardian-as-an-Advisor: Advancing Next-Generation Guardian Models for Trustworthy LLMs
摘要
严格控制的安全检查程序经常会过度拒绝并与供应商的型号规格不一致;流行的分类法也忽视了稳健性和诚实性,产生了纸上更安全但实用性较差的系统。这项工作引入了 Guardian-as-an-Advisor (GaaA),这是一种软门控管道,其中监护人预测二元风险标签和简洁的解释,并将此建议添加到原始查询中以进行重新推理,从而使基本模型在其原始规范下运行。为了支持训练和评估,构建了 GuardSet,这是一个 208k+ 多域数据集,将有害和无害的案例与有针对性的鲁棒性和诚实性切片统一起来。 GuardAdvisor 通过 SFT 进行训练,然后通过 RL 进行训练,以强制标签解释的一致性。 GuardAdvisor 实现了具有竞争力的检测精度,同时支持咨询工作流程;当用于增强输入时,响应会比未增强的提示有所改善。延迟研究表明,顾问程序推理使用的基本模型计算量低于 5%,并且在实际有害输入率下仅增加 2-10% 的端到端开销。总体而言,GaaA 引导模型遵守模型规范,保持安全性,同时减少过度拒绝。