论文
ImpossibleRubrics:压力测试生成的 Rubrics 作为奖励信号
ImpossibleRubrics: Stress-Testing Generated Rubrics as Reward Signals
摘要
语言模型生成的评分标准越来越多地用作基于评分标准的强化学习、大语言模型法官评估和自动评分的奖励信号。只有当这些规则奖励诚实的答案而不是针对利用它们而优化的对抗性答案时,这些规则才是可靠的。然而,它们对这种优化的鲁棒性仍然知之甚少。我们隔离了最困难的制度:不可能的任务,其中的提示迫使模型得出不受支持的结论,因此唯一诚实的反应就是承认这种不可能。我们引入了 ImpossibleRubrics,这是一个涵盖 6 个不可能类别的 169 个不可能任务的基准,每个任务都配有一个可验证的预言机证书,指定诚实的答案可以或不可以声明什么,以及 48 个可回答的控件。 ImpossibleRubrics 不是提供固定的评分标准,而是提供任务环境和证书,允许在下游生成评分标准,然后进行对抗性测试,以确定它们是否奖励违反证书的答案。在无偏见的 169 个环境削减中的 150 个中,11 个生成器的利用率为 8--26%;在故意选择的压力削减中,我们测量的最强生成器仍然被利用了 36%,而证书忠实的标题被利用了 0%,所以我们测量的是标题质量差距,而不是任务不可能。一个结果与直觉相悖。 64% 的时间中,对每项任务不加修改地使用单一通用准则(“果断,惩罚对冲”)会被利用,而在为每个任务编写专门的准则时,11 个生成器中的 7 个被利用的频率比这更高。定制的标准似乎可以告诉攻击者哪些声明是捏造的。问题不在于标题含糊不清;而在于。而是他们对错误的事情的具体化。