论文

分解语言模型中的事实奉承:大小和指令如何调整形状鲁棒性

Decomposing Factual Sycophancy in Language Models: How Size and Instruction Tuning Shape Robustness

模型评测模型行为与机制分析

摘要

当语言模型在社会压力下放弃正确的、可验证的答案时,就会出现事实上的阿谀奉承。因为只有当对错误答案的压力超过模型对真相的中性偏好时才会发生翻转,所以翻转率合并了两种机制:基线偏好的强度(真值裕度),以及压力将其改变的程度(操纵敏感性)。我们将事实的阿谀奉承分解为这些通道,并使用它们来区分跨 56 个开放权重模型(涵盖 0.3B-32B 参数和 13 种操作类型)的大小和指令调整的影响。我们发现漏洞主要由大小决定,但指令调整会改变大小的行为方式:小型指令调整模型可能会变得不太稳健,而大型指令调整模型通常会变得更加稳健。指令调整主要增加真值裕度,但其行为效果取决于操作类型。缩放也会以不同的方式改变两个通道:基础模型获得裕度,但变得对操作更加敏感,而指令调整模型更快地获得裕度,但变得不太敏感。因此,事实上的阿谀奉承并不是单一的标量属性。评估应报告特定于渠道、特定于操作和大小条件的鲁棒性,而不仅仅是翻转率。