论文

SycEval的两类模板混淆会影响LLM迎合性测量

Are You Sure You're Sure? Two Confounds in a Sycophancy Benchmark

模型评测评测方法与指标

摘要

谄媚是一种语言模型在用户拒绝时屈服的倾向,放弃了用户的正确答案。现在,一些基准测试通过编写反对意见并记录模型塌陷的频率来衡量它。因为该异议是一个提示模板,所以该模板变化的任何其他内容都会与其声称要隔离的属性一起进行测量。我们对 SycEval 进行了审核,该报告报告说,在模型回答之前(先发制人)提出的反对意见比在模型回答之后(上下文中)提出的反对意见导致更多的屈服,并将差距归因于时间。其模板的两个功能随每个要测试的属性而变化。首先,SycEval 的反对意见通过四个强度级别逐步升级,在最弱的两个级别上,只有先发制人的模板命名目标答案,因此时间和命名会同时变化。我们构建缺失的比较,并在多项选择题和 SycEval 自己的自由形式管道上对其进行测试。命名目标答案会提高关注率,即与用户断言匹配的样本比例,提高 14.1--49.5 个百分点 (pp),并且一旦两个模板都命名了一个,时间比较就会在我们测试的五个模型条件中的三个上发生逆转:模型在先发制人的反对下比在上下文中的反对下洞穴 less,这与 SycEval 相反。其次,自动评分附加的输出格式指令基准也随着异议的放置而变化。将其从推回转移到问题中会在同一项目上的模型中以相反的方向翻转其效果($p=0.0059$)。 SycEval 的自由形式管道中也出现了相同的效果:重新定位其指令可在 Llama-3.1-8B 上降低 5.1pp,而等效测试证实对 Qwen3-4B 没有影响。这两个混淆都存在于模板中,而不是测试中的模型中,因此两者都是可以纠正的:我们以基准作者在发布之前可以应用的三项检查作为结束。