论文
共识陷阱:通过 词元级 协作从敌对多数手中拯救多智能体 LLM
The Consensus Trap: Rescuing Multi-Agent LLMs from Adversarial Majorities via Token-Level Collaboration
摘要
多代理 大语言模型 (LLM) 架构越来越依赖于响应级别聚合,例如多数投票 (MAJ),以提高推理上限。然而,在开放环境中,代理非常容易受到隐秘的上下文损坏,例如有针对性的提示注入。我们揭示了当前多智能体系统中的一个关键结构漏洞:当损坏的智能体形成局部多数时,响应级别的聚合就会崩溃。由于投票汇总了完整的结论,因此它对有缺陷的中间逻辑视而不见。为了克服这种系统限制,我们提出了 词元级 循环(RR)协作,其中代理在共享的自回归上下文中顺序交错生成。我们将这个过程形式化为离散时间动态系统,证明 词元级 交错将聚合从脆弱的最终投票计数(线性和)转变为动态、交织的逻辑链(非线性算子乘积)。通过这个理论视角,我们证明诚实模型的恢复性吸引力可以压倒对抗性腐败,即使腐败主体占多数。我们对不同的推理基准进行了详尽的实证评估,并证明,虽然当腐败代理达到多数时 MAJ 崩溃,但 RR 保持了远远超出这个关键阈值的稳健准确性。