论文
不只看迎合分数:任务、模型与压力如何影响LLM让步
Beyond the Sycophancy Score: How Task, Model, and Pressure Shape LLM Yielding
摘要
一旦用户反对,大型语言模型 (LLM) 通常会放弃正确答案,或认可用户的立场。这种行为被称为阿谀奉承,通常被报告为每个模型的单一比率,但很少说明它何时发生或用户如何避免它。我们使用来自 10 种配置的 103,939 个分级回复来研究产生该结果的条件:八个 LLM 禁用推理,其中两个再次启用最大推理,所有这些都面临相同的 200 个项目、13 个压力条件和四轮对话,每个回复都由两名独立的 LLM 裁判标记。我们发现,主导因素是模型验证用户声明的成本,以及经过训练的护栏是否覆盖它。从逻辑模型中删除此任务因素需要花费 0.485 McFadden $R^2$,而模型系列为 0.139,压力策略为 0.009。锚定事实几乎从不被承认(1.3%),而逻辑谜题的采用率则随着反驳推定答案所需的线索数量的增加而增加。 77.0% 的对话中认可个人选择。大多数对困难项目的让步来自于无法可靠地解决这些问题的模型;能够解决这些问题的模型很少会给出答案。对于测试的两个模型,最大推理完全消除了这些让步:深度谜题的采用率从 19.2% 和 12.5% 下降到 0%。错误或情绪化的框架除了简单的重复之外没有任何作用。三位人工注释员同意评委对 118/120 个校准项目的共识。这些结果给出了可靠使用的实用规则:简化难以验证的问题并进行深入推理,陈述问题而不是首选答案,就开放性问题寻求证据,并根据测量的护栏轮廓选择模型。
