论文

附和的代价:测量智能体金融应用中的 LLM 谄媚

The Price of Agreement: Measuring LLM Sycophancy in Agentic Financial Applications

模型评测安全与风险评测

摘要

鉴于当今大语言模型(LLM)在金融系统中的使用日益增多,评估此类系统的安全性与鲁棒性变得十分重要。LLM 在通用领域场景中经常表现出的一种失效模式是谄媚(sycophancy)。也就是说,模型将附和用户表达的信念置于正确性之上,导致准确率和信任度下降。在这项工作中,我们聚焦于评估 LLM 在智能体金融任务中表现出的谄媚行为。我们的发现有三个方面:其一,我们发现面对用户反驳或与参考答案相矛盾的说法时,模型性能仅有轻微到中等程度的下降,这将金融智能体场景中的谄媚表现与此前研究的发现区分开来。其二,我们引入了一组任务,通过用户偏好信息与参考答案相冲突来测试谄媚,发现大多数模型在此类输入面前都会失败。最后,我们对不同的恢复模式进行了基准测试,例如使用预训练 LLM 进行输入过滤。

附和的代价:测量智能体金融应用中的 LLM 谄媚:论文配图
图1:金融智能体场景中谄媚行为的测量与缓解:理解并应对企业级LLM谄媚问题的三步方法总览。