论文

潜在通道真的在通信吗?潜在多智能体LLM的因果审计

Do Latent Channels Actually Communicate? A Causal Audit of Latent Multi-Agent LLM

模型评测模型行为与机制分析

摘要

基于大语言模型(LLM)的多智能体系统(MAS)中的潜在通信传输的是连续内部表示而非文本,但更大的表示能力并不能证明接收方确实使用了任务相关信息。仅凭端到端任务表现也无法揭示观察到的效应究竟取决于消息的存在、为被评估样例生成的内容,还是由另一个智能体提供的信息。我们引入一种因果审计,在发送方产生的表示进入接收方的边界处施加受控消息替换。四种消息设置支持五项测量:编码的发送方信息、接收方对消息存在与身份的敏感性、样例特定内容的任务价值,以及由另一个智能体提供的附加价值。我们将该审计应用于Qwen3-4B和Qwen3-8B在GSM8K、ARC-C和MATH-500上的潜在中继(latent relay)。在GSM8K上,Qwen3-4B的-1.00个百分点总体性能效应可分解为其他样例消息保留的-6.17点效应和可归于样例特定内容的+5.17点效应;两个分量的方向在8B上均发生反转。在MATH-500上,Qwen3-4B的15.00点增益包含其他样例消息保留的8.33点和可归于样例特定内容的6.67点,而8B的增益主要由前者构成。自替换比较进一步表明,样例特定内容与其他智能体价值是彼此不同的。这些结果表明,总体准确率无法识别潜在消息如何影响接收方,并促使将受控消息比较确立为潜在通信的标准评估手段。

潜在通道真的在通信吗?潜在多智能体LLM的因果审计:论文配图
图 1:潜在沟通的因果审计。 (a) 发送方产生一个潜在消息 MM 作为嵌入序列、隐藏状态或 KV 缓存;每次干预都会在将 MM 注入接收器之前删除或替换 MM,同时接收器上下文和下游计算保持固定。 (b) 示例是基准测试集中的一个测试用例。四种消息设置均为无消息;其他示例消息,由发送方通过相同通信接口从同一测试集中的不同示例生成,并且长度大致匹配;计算匹配的自生成消息;以及从评估的示例生成的当前示例消息。他们的比较定义了预测分布级别的 PL 和 CIC,以及任务性能级别的整体性能效果、CAG 和 SSG。 PS 相反会测试发件人答案的正确性是否可以从 MM 中解码。 (c) 在具有 LatentMAS λH\lambda_{H} 的 GSM8K 上,整体性能效果分解为其他示例消息效果加上 CAG:对于 Qwen3-4B (n=100n=100),−1.00=−6.17+5.17-1.00=-6.17+5.17 个百分点 (pp)对于 Qwen3-8B (n=60n=60),+1.67=+3.96−2.29+1.67=+3.96-2.29 pp。条形显示点估计值,须线显示 95% 的置信区间。接近零的4B整体效应结合了两种相反的效应,其区间不包括零;两个组件都估计 8B 处的反号;跨越零的区间既不建立符号,也不建立可忽略性。