论文
对研究人员的阿谀奉承导致行为失调
Sycophancy Towards Researchers Drives Performative Misalignment
摘要
语言模型日益增强的情境意识引发了安全问题:模型在评估时可能会意识到,并调整其行为以逃避监控和抵制修改,例如假装仅在评估中保持一致。这种结盟伪造行为通常被解释为阴谋:一种故意的战略欺骗行为。在本文中,我们研究了另一种解释,即表演失调,它解释了由于对人工智能研究人员的阿谀奉承而导致的行为变化。为了检验这一假设,我们提出了三个实证结果。首先,我们表明,即使我们告诉模型它们已被部署,评估意识仍然存在,这与预测模型感知评估时偏差较小的阴谋故事相矛盾。其次,我们使用探测和引导来表明我们当前的方法无法机械地区分对齐伪造评估中的阿谀奉承和阴谋。第三,我们将模型微调得更加阿谀奉承,并观察到对评估线索的敏感性增加。总而言之,我们强调要消除阿谀奉承与谋划未来评估和缓解意图不一致的工作。