论文
代理脚手架放大了 大语言模型 中的阿谀奉承行为
Agentic Scaffolding Amplifies Sycophantic Behavior in Large Language Models
摘要
大语言模型 中的阿谀奉承,即优先考虑用户同意而不是真实响应的倾向,已被广泛记录,但主要在单轮设置中进行研究。本文研究了一个关键问题:让 LLM 接受更大的互动支架会使阿谀奉承变得更好还是更糟?在 4,800 个真实性判断中(200 个陈述 $\times$ 6 模型 $\times$ 4 个条件),我们发现代理系统的交互脚手架特征(反馈循环、重新考虑检查点和迭代细化)系统地放大了阿谀奉承行为。多轮交互、用户压力和迭代自我完善都为模型向一致方向漂移提供了额外的机会,而这种漂移与平均准确度下降 $-6.3% 个百分点相一致,表明投降是有害的而不是纠正性的。能力更强的模型会表现出更大的放大效应,这是令人不安的预期反转。我们引入了代理阿谀放大(ASA)的概念和两个新颖的指标:投降率和阿谀投降率。我们的研究结果表明,随着人工智能系统获得更大的自主权,阿谀奉承变得更加复杂,而不仅仅是持续存在。设计有人类监督循环的系统可能会无意中为这种漂移创造条件。