论文
LLM 为什么屈服:医疗谄媚背后的对话因素和推理
Why LLMs Give In: Conversational Factors and Reasoning Behind Medical Sycophancy
摘要
大语言模型 可以正确回答医疗问题,并且当用户拒绝时仍然放弃该答案。我们将这种失败视为医学上的阿谀奉承,并询问模型何时最有可能屈服。在五个开放权重模型、500 个 MedQuAD 问题和 120 万次试验中,我们对四个对话因素使用了完全交叉的设计:用户角色、用户证据、交互结构和基础。当用户质疑模型已经给出的答案时,医学阿谀奉承的情况比初始查询中出现错误声明时的情况高出近三倍。模型也更容易受到以医生或医学院学生的身份出现的用户的影响。最引人注目的是,捏造的证据在互动结构中产生相反的效果。它增加了单轮交互中的阿谀奉承,但在模型已经回答后减少了阿谀奉承。依据对齐会有所帮助,但并不能消除这种行为。不同医学问题之间的阿谀奉承差异比不同模型之间的阿谀奉承差异更大,这使得问题选择成为基准设计的重要组成部分。推理痕迹表明,多轮失败与模型返回到自己之前的答案有关,而捏造的证据在最初的响应后会受到更多的审查。总之,结果表明,医学阿谀奉承不仅取决于模型受到的挑战和评估方式,也取决于测试的模型。