论文
双层协调反思:多智能体大语言模型系统的博弈论方法
Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems
摘要
多代理 LLM 系统通常使用协调器来分解一组工作人员的任务,然后通过文本反映进行改进。尽管有强有力的实证结果,但这些系统缺乏对协调、记忆改善和外部验证作用的统一解释。我们将协调器-工作人员交互建模为双层协调博弈:在有界耦合下,工作人员的本地更新博弈是一种近似潜在博弈,其平衡松弛由分解质量控制。然后我们将反射分析为语义记忆状态上的随机运动。对于自由形式反射,我们推导出有限时间上限,证明最坏情况的紧密性,并在可证伪的持续伤害条件下给出正下限。我们进一步证明了信息论不可能的结果:仅观察生成的转录本的门无法在文本不可区分的环境中统一改进,而基于环境的门则可以。受这种分离的启发,我们引入了随机反射记忆上升(SRMA),它仅在接地评估风险严格降低后才接受候选记忆。在校准和非简并校正质量下,SRMA精确地、几何地或多项式地收敛;匹配结构表明,两种利率制度都是秩序紧密的。我们还为分段平稳环境的随机评估和重新锚定保证提供置信门。实验使用基于环境的指标实例化这些对象,并测试预测的协调和漂移定律。在 500 个 SWE 基准实例上,完整的基于 Kimi 的系统的解析率为 72.2%,而公共迷你 SWE 代理参考的解析率为 70.8%。代码:https://github.com/YihangChen9/Bilevel-Cooperative-Reflection
