论文
多大语言模型审议中的混沌动力学
Chaotic Dynamics in Multi-LLM Deliberation
摘要
集体人工智能系统越来越依赖于多位大语言模型的审议,但其在重复执行下的稳定性仍然较差。我们将五代理大语言模型委员会建模为随机动力系统,并使用从委员会平均偏好的轨迹分歧中得出的经验李雅普诺夫指数($\hat{\lambda}$)来量化运行间敏感性。在 12 种政策情景中,$T=0$ 的因子设计确定了两条独立的不稳定途径:同质委员会中的角色分化和无角色委员会中的模型异质性。至关重要的是,这些影响甚至出现在 $T=0$ 制度中,从业者通常期望确定性行为。在 HL-01 基准中,两条路线都会产生较高的分歧(分别为 $\hat{\lambda}=0.0541$ 和 $0.0947$),而同质无角色委员会也保持正分歧状态($\hat{\lambda}=0.0221$)。组合的混合+角色条件比混合+无角色条件更不稳定($\hat{\lambda}=0.0519$ vs $0.0947$),显示出非加性相互作用。从机制上讲,主席角色消融最有力地减少了 $\hat{\lambda}$,而缩短记忆窗口的目标协议变体进一步减弱了分歧。这些结果支持稳定性审计作为多大语言模型治理系统的核心设计要求。
