论文
EncBank:跨大模型查询复用紧凑文档编码缓存
Cache the Encoder Within:Compact, Reusable Memory across LLM Queries
摘要
对共享文档进行重复查询会产生冗余编码,而缓存模型状态又会增加持久存储成本。基于CoMem的中间状态接口,EncBank把预训练LLM的底层视为可复用的文档编码器,紧凑存储其输出,供经过适配的上层读取器使用。在每个骨干模型内,同一个自蒸馏后缀适配器可适用不同存储精度,无需针对量化重新训练。在三个覆盖不同规模、全注意力和混合架构的Qwen骨干上,以五组基准套件评测,4比特存储使每项已报告的基准汇总分与原生精度EncBank相差不到一分。在固定的Qwen3-8B负载中,持久GPU存储仅为原生精度的28.1%。另外的原生精度对照显示,与相同证据、相同适配器的文本重放相比,所选数据包的预填充加速为1.40倍,但RULER准确率下降3.12分。原生精度Qwen3.8-27B配置也通过了89个Terminal-Bench 2.1任务中的70个。因此,EncBank结合了计算复用与紧凑记忆,但任务忠实度和端到端收益仍取决于负载、准备成本和复用频率。