论文
从可靠到善表达:量规遵循安全裁判的课程
Reliable to Expressive: A Curriculum for Rubric-Following Safety Judges
摘要
安全法官越来越多地根据不断变化的标准来评估模型输出,但最近的元评估工作表明,它们在提示和标题变化下仍然很脆弱,仅报告风格扰动的假阴性率波动就高达 0.24。我们认为,安全判断从根本上来说是一个遵循规则的问题:一个强有力的判断者必须在整个规则表述中一致地应用给定的评估标准,而不是记住一个特定的模板。我们提出了一种培训策略,该策略结合了(i)从提示-响应-标签三元组生成的实例条件动态评估标准,以使法官了解评估标准的可变性,以及(ii)可靠的表达课程,从干净的固定评估标准监督开始,并逐步引入噪声较大的动态评估标准数据。我们在三个对比的标题提示(HarmBench 样式、ShieldGemma 样式和特定领域的标题)下对单个人类标记集进行评估。我们的 12B 课程法官在三个评分标准中的准确率达到 94.12-94.88%,跨评分范围仅为 0.76,在峰值准确度和稳定性方面均优于通用大语言模型、专用安全分类器和高达 30B 的推理型法官。消融表明,天真地将动态量规混合到 SFT 中会增加跨量规方差 (1.44 -> 3.60);只有课程安排在固定的基准基线(方差 0.76)上恢复和改进。
