论文

当潜在代理撒谎时:多代理 LLM 协作中的 KV 缓存完整性

When Latent Agents Lie: KV-Cache Integrity in Multi-Agent LLM Collaboration

模型评测安全与风险评测

摘要

LLM 座席可以共享的不仅仅是文本。在某些系统中,代理可以发送短的可见消息,同时还将其完整的 KV 缓存状态传递给另一个模型。这种隐藏状态可以帮助最终模型结合来自多个代理的证据,但也很难检查。即使隐藏状态已更改,可见消息也可能看起来无害。我们在多智能体问答设置中研究这个问题。专家们各自查看部分证据,发送简短的承诺,并将完整的 KV 缓存状态传递给协调员。在干净的运行中,这种潜在的协作比匹配的纯文本版本有所改进。在使用 Qwen3-4B 进行改造的 HiddenBench 上,其 EM/F1 达到 0.338/0.486,而文本协作的 EM/F1 为 0.231/0.369。 Qwen3-8B 和 HotPotQA 运行显示出相同的改进方向。当一位专家恶意时就会出现问题。一些虚假的可见承诺可以引导答案。更严重的是,改变隐藏的 KV 状态可能会导致性能崩溃,即使可见的承诺看起来仍然合理。仅检查文本的验证程序会错过这种故障模式。简单的幅度检查会发现一些明显的损坏,但自适应攻击可以逃避它们,同时仍然会损害最终的答案。我们发现的最可靠的解决方法不是猜测隐藏状态看起来是否正常,而是在传输中保护它。我们实现了一个 HMAC-SHA256 清单,它绑定了专家、会话、模型、可见承诺、张量元数据和有效负载摘要。它接受所有 774 个诚实重放的有效负载,并拒绝所有 295 个记录的篡改有效负载。主要的教训是,全 KV 潜在内存可能很有用,但应将其视为安全敏感对象,而不是普通的内部模型状态。