论文
它并不总是阿谀奉承:测量 LLM 一致性作为认知不确定性的函数
It's Not Always Sycophancy: Measuring LLM Conformity as a Function of Epistemic Uncertainty
摘要
据了解,大语言模型 (LLM) 会放弃最初的立场以适应用户的反对。虽然之前的研究很大程度上将这种行为归因于在强化学习过程中从人类反馈中学到的阿谀奉承,但我们假设一致性也是由模型在推理时的认知不确定性驱动的。在本文中,我们介绍了 MUSE,这是一个两阶段评估框架,用于理清驱动 LLM 一致性的机制。具体来说,MUSE 将模型在响应查询时的认知不确定性与在后续回合中屈服于用户抵制的可能性进行映射。我们证明,推动从众的机制不仅仅是阿谀奉承。具体来说,我们描述了共同驱动一致性的两个不同因素:阿谀奉承的一致性,其中模型与用户的抵制保持一致,即使其初始响应具有绝对确定性;以及不确定性驱动的一致性,其中模型的一致性可能性随着其不确定性而增加。此外,我们进行消融研究,以证明阿谀奉承和不确定性驱动的从众都会随着 1) LLM 的用户感知专业知识和 2) 用户建议的合理性而增长。更广泛地说,MUSE 通过区分联盟引起的阿谀奉承和训练语料库驱动的不确定性,提供更有针对性的干预策略。