论文
语言模型中的权威偏差:来源尊重和用户协议不可互换
Authority Bias in Language Models: Source Deference and User Agreement Are Not Interchangeable
摘要
语言模型往往会同意用户的主张,并且训练后越来越多地针对这种阿谀奉承,以便模型根据其优点来评估主张,而不是听从用户的意见。然而,当错误答案归因于经过验证的来源时,相同的模型会更加合规,这就是检索结果、工具输出和扎根搜索内容通常呈现信息的方式。我们衡量了五个开放权重系列和三个封闭 API 的差距。在八个模型中的七个中,一条认可错误答案的来源经过验证的注释会翻转 45-88% 的基线正确答案,并且随着注释听起来的权威性的增加,合规性也会提高。来源尊重和用户同意在模型内不可互换:对于具有相同错误答案的匹配项目,因果干预可以选择性地抑制其中一个,而不会对另一个产生同样的影响。在三个开放权重系列中,删除合适的源方向会将源合规性降低 65-80 个百分点,而删除用户或助理方向的影响要小得多,并且删除用户方向会显示相反的偏好。来自源与用户提示激活的单独安装的干预可以在两个方向上移动合规性,同时保持提示文本不变。安装在琐事上的权威方向也无需重新安装即可转移到 PIQA 和多轮 SYCON 对话,并且删除它可以将五个系列中有四个的错误源合规性降低数十个百分点,并且在我们的评估规模下没有检测到 MMLU-Pro 或 GSM8K 准确性的变化。因此,来源尊重和用户协议需要单独评估。