论文

面向视觉多智能体系统的双潜在记忆

Dual Latent Memory for Visual Multi-agent System

上下文与知识记忆Agent记忆

摘要

虽然视觉多代理系统(VMAS)承诺通过代理间协作来增强综合能力,但经验证据揭示了一个违反直觉的“缩放墙”:增加代理轮次通常会降低性能,同时呈指数级增加token成本。我们将这种失败归因于以文本为中心的通信固有的信息瓶颈,将感知和思维轨迹转换为离散的自然语言不可避免地会导致语义丢失。为此,我们提出了 L$^{2}$-VMAS,这是一种新颖的模型无关框架,可以实现具有双重潜在记忆的智能体间协作。此外,我们在动态合成双重潜在记忆的同时,将感知和思维解耦。此外,我们引入了一种熵驱动的主动触发,用高效的按需内存访问取代了被动的信息传输。在骨干网、规模和多代理结构之间进行的大量实验表明,我们的方法以卓越的可扩展性有效地打破了“扩展墙”,将平均准确率提高了 2.7-5.4%,同时减少了 21.3-44.8% 的token使用量。代码:https://github.com/YU-deep/L2-VMAS。

面向视觉多智能体系统的双潜在记忆
图4:我们提出的 L2-VMAS 概览。