论文

QKVShare:面向端侧多智能体LLM的量化KV缓存交接

QKVShare: Quantized KV-Cache Handoff for Multi-Agent On-Device LLMs

模型推理KV Cache

摘要

边缘设备上的多智能体LLM系统需要高效交接潜在上下文,但如今的实际选择是昂贵的重新预填充或全精度KV传输。我们研究QKVShare:一个智能体间量化KV缓存交接框架,结合token级混合精度分配、自包含的CacheCard表示与HuggingFace兼容的缓存注入路径。当前结果支持一个比原稿更窄但更清晰的故事:在150道GSM8K问题与Llama-3.1-8B-Instruct上,自适应量化在反复交接下保持竞争力,并在更深跳数、更高预算 setting 下相对均匀量化展现最清晰的收益;交接时延方面,QKVShare路径在每个受测上下文下都较完整重新预填充降低TTFT——从标称1K上下文的130.7毫秒对150.2毫秒,到标称8K上下文的397.1毫秒对1029.7毫秒。阶段计时显示,当前QKVShare时延路径的主导项是注入后的生成而非卡片创建。这些结果把量化KV交接定位为有前景的端侧系统方向,同时也凸显对更强控制器消融与同口径运行时对比的需求。