论文

面向高效多智能体辩论的跨模态记忆压缩

Cross-Modal Memory Compression for Efficient Multi-Agent Debate

上下文与知识上下文工程

摘要

多智能体辩论可以提升推理质量并减少幻觉,但随辩论轮次与智能体数量增加,上下文快速增长。保留完整文本历史会导致token用量超出上下文限制,且常需反复摘要,增加开销并加剧信息损失。我们提出DebateOCR,一个跨模态压缩框架,用紧凑的图像表示替换冗长的文本辩论轨迹,再经专用视觉编码器消费,以条件化后续轮次。这一设计压缩了通常横跨数万到数十万token的历史,输入token削减超过92%,并在多个基准上带来显著更低的计算成本与更快推理。我们进一步给出一个理论视角,表明智能体间的多样性支持被省略信息的恢复:虽然任何单一压缩历史可能丢弃细节,但聚合多个智能体的压缩视图能使集体表示以指数级高概率逼近信息瓶颈。

面向高效多智能体辩论的跨模态记忆压缩
图2:多智能体辩论的视觉压缩框架。上:基于文本的辩论在各轮中累积 token 数。下:我们的方法将辩论历史转换为视觉表示。我们首先训练一个轻量级投影器,将 SAM-CLIP 特征适配到目标 MLLM 的视觉嵌入空间。推理时,辩论历史文本通过 SAM 编码为图像,经由 CLIP 嵌入,并投影为少量视觉 token,在为后续轮次保留辩论上下文的同时实现 token 缩减。