论文

DICE:稳定多智能体 LLM 协调的熵正则平衡选择

DICE: Entropy-Regularized Equilibrium Selection for Stable Multi-Agent LLM Coordination

智能体系统Agent 协作

摘要

多智能体 大语言模型 (LLM) 系统通常无法可靠地超越配备有最佳 N 采样的单一强大模型。我们认为,这种不稳定的核心根源是不适定的均衡选择:当前的系统指定了代理共享哪些信息,但没有指定应该选择哪种协调约定。我们将一类广泛的此类系统形式化为折扣不完全信息马尔可夫博弈,并表明两种常见的病态,即竞争惯例之间的振荡和跨越它们的漂移,都可能导致不稳定的学习和线性贝叶斯遗憾。为了获得适定目标,我们引入了异质量子响应平衡(HQRE),这是一种具有与主体和状态相关的温度的熵正则化平衡概念。在单调性条件下,HQRE是唯一的,允许线性收敛镜像更新,并产生有界贝叶斯遗憾;相同的条件产生可测量的稳定性诊断。我们用两种算法实例化这个目标:DICE-PC,它通过提示控制动作协调冻结模型;DICE-FT,它执行参数高效的镜像 微调。在四个领域的 11 个基准测试中,DICE 在强大的同类基准基础上改进了准确性与成本的权衡;在推理和规划任务上,DICE-PC 平均提高了 4.3 个百分点,DICE-FT 平均提高了 8.5 个百分点。