论文
ArborKV:面向树状LLM推理扩展的结构感知KV缓存管理
ArborKV: Structure-Aware KV Cache Management for Scaling Tree-based LLM Reasoning
摘要
LLM推理的最新进展日益从单遍生成转向对中间推理状态的显式搜索。思维树(Tree-of-Thoughts, ToT)把推理组织成带分支与回溯的树状搜索,但会大幅放大键值(KV)缓存:为部分轨迹的前沿保留KV状态很快成为内存瓶颈,在固定硬件预算下限制吞吐量并约束搜索深度与宽度。我们应对这一挑战的出发点是一个观察:ToT式推理中的KV复用由搜索动态支配——近期解码主要依赖活跃分支及其祖先,而非活跃子树的短期复用概率低,但必须保持可恢复以支持回溯。受此启发,我们提出ArborKV,一个结构感知的驱逐框架,它将轻量价值估计器与树感知分配策略相耦合,执行纯token抽取式驱逐并辅以惰性重灌以支持重访。在ToT式推理基准上的实验表明,ArborKV实现最高约4倍的KV峰值内存削减,同时保持接近全保留的准确率,使得在固定设备预算下原本会内存耗尽的更大搜索配置成为可能。