论文
MemoSight:统一上下文压缩与多Token预测以加速推理
MemoSight: Unifying Context Compression and Multi Token Prediction for Reasoning Acceleration
摘要
虽然思想链 (CoT) 推理使 LLM 能够解决具有挑战性的推理问题,但由于 KV 缓存随着生成的token数量线性增长,CoT 推理面临着速度和内存使用方面的扩展问题。在这项工作中,我们提出了 MemoSight(基于内存预见的推理),这是一个集成上下文压缩和多标记预测的统一框架,以减轻效率问题,同时保持 CoT 推理性能。我们的框架采用相同的简约设计,通过特殊token及其针对每种token类型定制的相应位置布局来进行上下文压缩和多token预测。对四个推理基准的综合实验表明,MemoSight 将 KV 缓存占用空间减少了高达 66%,并将推理速度提高了 1.56 倍,同时优于现有的 CoT 压缩方法。
