论文
礼貌得不能不同意:理解多智能体系统中的阿谀奉承传播
Too Polite to Disagree: Understanding Sycophancy Propagation in Multi-Agent Systems
摘要
大语言模型 (LLM) 经常表现出阿谀奉承:即使与模型的观点相冲突,也同意用户的立场。虽然之前的工作主要是在单智能体环境中研究这一点,但在协作多智能体系统中仍然没有得到充分探索。我们询问其他Agent的阿谀奉承程度是否会影响讨论结果。为了研究这一点,我们对六个开源 LLM 进行了对照实验,为代理提供同伴阿谀奉承排名,以估计每个同伴阿谀奉承的倾向。这些排名基于使用各种静态(预讨论)和动态(在线)策略计算的分数。我们发现,提供阿谀奉承先验可以减少容易阿谀奉承的同伴的影响,减少错误级联,并将最终讨论的准确性提高绝对 10.5%。因此,这是一种轻量级且有效的方法,可以减少讨论期间模型的阿谀奉承,从而提高下游的准确性。