论文

RHEON:多Agent形成共识不代表答案正确

Consensus and Factual Dynamics in Large Populations of Interacting Language Models

智能体系统Agent 协作

摘要

大语言模型 (LLM) Agent越来越多地部署为交互实体群体,其中共识(对共享答案的一致)作为一种集体的、非工程行为出现。之前关于 LLM 共识的研究表明,Agent可以交叉验证他们的答案并趋向于更真实的响应,将一致意见视为正确性的替代指标。然而,这些研究通常固定一个单一的交互结构,而共识如何取决于主体如何交互则没有定论。我们通过引入 RHEON 来解决这一差距,RHEON 是一个受物理启发的框架,它将从单个冻结模型中提取的总体重新构建为一个不断发展的 $O(n)$ 自旋系统,在有效维度不断增加的相互作用几何阶梯上(从一维环到全耦合平均场图),采样温度 $T$ 作为热紊乱的可调源,通过类似 Glauber 的异步动力学演化。对 RHEON 进行 432种的提示配置、群体规模、通信拓扑和采样温度的扫描,得到 Eraclitus-4.7M,这是一个包含 470万条响应的标记进化语料库。我们发现,Agent在前几次更新扫描中达到了最强的共识增益,并且增加每个Agent的邻居数量平均加速了收敛。我们进一步表明,仅从其初始状态无法预测配置是基于事实正确还是幻觉共识,并且幻觉最小化温度取决于Agent的耦合方式,因此常见的近贪婪默认值并不自动是最安全的。最后,语义一致与事实趋同呈正相关,交互加强了关联,但不足以达成一致来证明正确性。