论文

Nexus:统一内存上Agentic LLM的深度自适应KV缓存拼接与检索解耦工具路由

Nexus: Depth-Adaptive KV-Cache Splicing and Retrieval-Decoupled Tool Routing for Agentic LLMs on Unified Memory

智能体系统Agent 工具调用智能体互操作协议MCP

摘要

模型上下文协议(MCP)上的Agentic大语言模型(LLMs)每一轮都重新编码冗长的工具模式(schema),因此随着工具注册表增长,预填充(prefill,对序列长度呈二次方)主导了首token生成时间(TTFT)。Nexus的主要杠杆是把路由与模式预填充成本解耦:一个带校准交叉编码器边际门的INT8语义旁路缓冲(SLB)通过检索选择工具,参数在压缩文本签名(中位数19个token)之上生成,而不是在拼接的键/值(KV)缓存之上。这条路径与深度无关:当注册表扩展到250个工具时,路由准确率保持在约89%——在这个规模上“拼接全部模式”的基线完全溢出上下文窗口——并且比全模式重新预填充早1.66倍到达首个参数token,同时节省约80%的主上下文token。作为次要的、有边界的杠杆,我们把一个编译好的模式KV块直接移植进活跃上下文。这从根本上受限于旋转位置编码(RoPE)相位漂移:锚定拼接在输出上是精确的,但偏离锚点的放置会破坏注意力,因此在超过阈值P=256后,Nexus用深度自适应的后缀重解码修复接缝,并升级到完全重新预填充。由此得到的“永不回退”性质是对输出保真度(top-1一致、D_KL约为0)的保证——而不是对延迟的保证,延迟可能降到0.98倍之后才收敛到持平——同时在中等深度有1.1–1.7倍的TTFT加速,在深上下文时收敛到持平。两个负面结果界定了这一设计:偏离锚点的RoPE保真度边界,以及无参考漂移门无法预测漂移(Spearman rho = 0.193)。所有测量均来自Apple芯片统一内存上的一个模型组合(Qwen2.5-14B-Instruct Q4_K_M);定性边界可以推广,而定量范围是该组合特有的。