论文

双层协调反思:多智能体大语言模型系统的博弈论方法

Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems

智能体系统上下文与知识记忆Agent 协作Agent记忆

摘要

多代理 LLM 系统通常使用协调器来分解一组工作人员的任务,然后通过文本反映进行改进。尽管有强有力的实证结果,但这些系统缺乏对协调、记忆改善和外部验证作用的统一解释。我们将协调器-工作人员交互建模为双层协调博弈:在有界耦合下,工作人员的本地更新博弈是一种近似潜在博弈,其平衡松弛由分解质量控制。然后我们将反射分析为语义记忆状态上的随机运动。对于自由形式反射,我们推导出有限时间上限,证明最坏情况的紧密性,并在可证伪的持续伤害条件下给出正下限。我们进一步证明了信息论不可能的结果:仅观察生成的转录本的门无法在文本不可区分的环境中统一改进,而基于环境的门则可以。受这种分离的启发,我们引入了随机反射记忆上升(SRMA),它仅在接地评估风险严格降低后才接受候选记忆。在校准和非简并校正质量下,SRMA精确地、几何地或多项式地收敛;匹配结构表明,两种利率制度都是秩序紧密的。我们还为分段平稳环境的随机评估和重新锚定保证提供置信门。实验使用基于环境的指标实例化这些对象,并测试预测的协调和漂移定律。在 500 个 SWE 基准实例上,完整的基于 Kimi 的系统的解析率为 72.2%,而公共迷你 SWE 代理参考的解析率为 70.8%。代码:https://github.com/YihangChen9/Bilevel-Cooperative-Reflection

双层协调反思:多智能体大语言模型系统的博弈论方法:论文配图
图1 双级协调反思。乐团主讲人( 领奏) 选择一个分解 \\ tu \ 并更新战略记忆 mom \ } 在较慢的时标上; 工人 (追随者) 通过 \ c\ deta \ c } - 更好的反应, 在较快的时标上 。在连接下,追随者的子游戏是一种近似潜在的游戏, 松懈了 ccleq 2dmaxkappa, 而验证器的SRMA则单独决定要执行哪些存储建议。