论文

大规模盒式磁带:在大型文档集合上训练模块化 KV 缓存

Cartridges at Scale: Training Modular KV Caches over Large Document Collections

模型推理KV Cache

摘要

大语言模型 可以在长上下文中进行推理,但预填充数百万个词元是浪费的,因为大部分内容在查询中保持静态。盒式磁带通过将文档集合提取到可重用的键值 (KV) 缓存中来解决此问题,从而消除预填充,同时保持准确性。这种方法的一个关键限制是卡盒是整体的和非组合的:将整个集合编码到单个 KV 块中无法扩展,并且天真地混合经过隔离训练的卡盒几乎会导致性能崩溃。我们推出了 Cartridges at Scale (CAS),这是一种用于可扩展多磁带学习的训练框架,具有动态干扰混合和内存高效的预算管理器,可在 GPU 和持久存储之间轮换数百个每个文档的磁带。我们的方法可扩展到超过 100 万个词元的集合,在可比的 词元预算 中比单片盒改进了 10-31 个点。即使在高压缩下,Oracle 卡带的准确度也会在完全上下文学习的情况下下降 2-6 个点。当与盒式磁带选择检索配合使用时,CAS 可以达到或超过传统 RAG 的精度,同时消耗的提示词元数量减少 3-4 倍。