论文

KITE:按任务需求选择多Agent之间传递的KV层

Task-Oriented Key-Layer KV Communication for Efficient Latent Multi-Agent Collaboration

智能体系统模型推理KV CacheAgent 协作

摘要

基于大型语言模型的多智能体系统通过协作改进复杂问题的解决,而潜在通信直接传输模型内部状态,以避免自然语言的高推理成本。然而,现有的基于 KV 的潜在通信方法优先考虑发送方状态保真度,导致大量的通信和计算开销,并可能引入冗余信息。为了解决这些限制,我们从面向任务的角度重新审视潜在通信,将其目标从发送方状态保真度转变为接收方任务充足性。 Under this formulation, we propose KITE, a training-free framework for task-oriented key-layer KV communication. KITE使用接收器轨迹失真标准识别任务有效关键层,仅传输与关键层相关的潜在工作记忆,并进一步使用同一层作为自回归潜在推理的入口点。在两个模型族、三个模型尺度的七个基准测试上的实验表明,与全层KV通信相比,KITE减少了28-36$\times$的通信量,实现了高达3$\times$的端到端推理加速,并将准确率提高了高达23.3个百分点。

KITE:按任务需求选择多Agent之间传递的KV层:论文原图
图 2:KITE 框架概述。关键层校准(顶部)通过接收器轨迹失真来识别任务有效的 KV 层。代理通过关键层潜在工作记忆进行通信(底部),并使用同一层作为潜在推理的入口点。