论文

语言模型代理之间的潜在通信:通道、对齐和文本限制

Latent Communication Between Language Model Agents: Channels, Alignment, and the Limits of Text

智能体系统Agent 协作

摘要

多代理系统 (MAS) 在许多环境和许多职业中都有使用。这些 MAS 依赖于代理间通信,通常通过明文消息传递来实现。我们假设,当需要传达复杂的概念时,大语言模型 可能拥有一个可以使用的世界模型,该模型超出了文本的表达能力。我们的目标是通过结构化实验来证明这一假设。在这项工作中,我们展示了通过文本进行通信的 LLM 代理会丢失信息,我们通过稀疏自动编码器(SAE)特征分析来量化这些信息。我们构建了三个沟通渠道并测量每个渠道中的概念区分信息。我们首先表明,SAE 稀疏通道在 28 倍压缩下比密集潜在通道保留了 99.4% 的探测精度,而文本通道则为 80.4%。然后,我们继续使用稀疏潜在空间对齐来检查跨架构通信的相同情况。我们发现对于 Procrustes 对齐,Llama 和 Mistral 之间的 top-1 检索率为 92%。使用文本往返,我们执行特征生存分析,发现文本序列化破坏了 88% 的 SAE 特征,并用不同的特征集替换它们。我们将损失归因于身份替换,而不是衰减。通过我们的分析,我们能够将 3-10pp 的性能损失归因于线性 Procrustes 对齐,并通过非线性对齐方法进行改进。在任务级评估中,我们发现潜在通道与跨语言概念任务上的文本通道匹配,但从未超过它。具有潜在特征的文本增强没有提供任何好处,导致我们对最初的假设得出负面结论:丢失的特征大部分或完全编码表面形式,而不是与任务相关的语义。为了确定潜在通信相对于文本通道的实际优势,需要引出复杂概念的更深入的任务和相应的分析框架。