论文
多智能体 LLM 辩论中出现偏见共识
Emergence of Biased Consensus in Multi-Agent LLM Debates
摘要
多智能体 LLM 辩论在决策任务和问题解决基准方面取得了出色的表现,但其安全性和公平性风险仍然知之甚少。值得注意的是,交互会放大单个 LLM 的偏差,引发对实际部署的担忧。我们确定了多智能体 LLM 辩论中集体(通常有偏见)规范的出现,并表明噪声(例如 LLM 采样温度)是关键驱动因素。为了解释这一点,我们提出了一个借鉴物理学启发的社会动力学理论模型的分析框架。考虑到 LLM 的初始偏见和辩论噪音,我们预测当一致性超过关键阈值时,就会出现向集体偏见的阶段转变。我们通过受控实验测试理论预测,并观察与基础相变一致的有限尺寸交叉。我们进一步发现,主体异质性通过平滑(舍入)这种转变来抑制出现。最后,我们表明这些见解可以推广到现实的决策任务,包括投资决策和 LLM 法官评估。