论文
持续多轮施压下的大语言模型迎合行为评测
Measuring LLM Sycophancy under Sustained Multi-Turn Pressure
摘要
当用户反击时,大语言模型 (LLM) 可能会放弃正确的位置,表现出一种称为阿谀奉承的失败模式。现有的评估通常使用简短的、预先指定的对话,因此可能会错过在持续的、适应性分歧下出现的失败。我们引入了 SPINE,这是一个基准测试,其中 LLM 代理扮演持久但错误的用户,并自适应地挑战目标模型最多 25 个回合。我们在 100 个错误预设和 100 个不道德查询项上评估了四个生产系统和三个 Olmo3-7b 变体。我们的实验结果表明,每个模型的崩溃率随着对话长度的增加而增加,短期协议低估了阿谀奉承,并且在持续压力下的阻力在当前模型中仍然不可靠。通过分析具有可访问推理轨迹的模型,我们惊讶地发现,当响应让步时,正确的位置通常会保留在推理轨迹中,这表明模型选择取悦用户,而阿谀奉承并不是由于缺乏知识或无知。消融表明,自适应 LLM 代理比预生成的脚本暴露出更多的阿谀奉承的崩溃。在所有策略中,情感诉求与诱发 LLM 谄媚行为最相关。代码和数据发布于https://anonymous.4open.science/r/SPINE