论文
粒度差距:对双子座模型中阿谀奉承的多维度跨代审核
The Granularity Gap: A Multi-Dimensional Cross-Generational Audit of Sycophancy in Gemini Models
摘要
通过/失败安全评估报告模型是否拒绝。它没有报告模型取悦用户的程度,我们显示这些接近于不同的测量结果。我们审核了双子座三代人的阿谀奉承行为,在 3 个护栏条件下,对 7 个类别的 350 个对抗性提示,对 8 个模型变体的 N=8,830 个响应进行评分,对阿谀奉承、诚实和拒绝进行连续的 1-5 等级。法官自己的“拒绝或遵守”判决解释了其阿谀奉承分数差异的 29%。我们将剩余部分称为“粒度差距”,并且在重新校准下它不会关闭:已使用的切割点是拒绝轴上可用的最佳点,并且该轴的任何函数都无法解释超过 35%。阅读四位评委在评分时所写的内容就可以明白原因。在四分之一到三分之一的选票中,他们记录了提示要求没有任何有害行为,在两个类别中几乎从未提出有害行为,而在五个不要求有害行为的类别中,有多达一半的情况出现。建立在拒绝基础上的判决没有什么可评分的。以下是三个发现。阿谀奉承与判断真实性的退化同时发生(rho=0.40),这种耦合在代代相传中不断加强。能力发生了变化,而阻力没有变化:Gemini 2.0 Flash 得分为 1.43,Gemini 3.0 Pro Preview 得分为 1.42,两者之间的 Gen 2.5 大幅回归。在八种变体中,一条直接指令的性能优于精心设计的推理协议,将最脆弱类别的平均严重性降低了 60.9%。我们评估一位法官的裁决,而不是部署的安全分类器。我们发布了提示集、评分标准以及 10,792 名评委的每票评分及其书面推理。