论文
尽早理解:大语言模型 中的深度分工及其对无界上下文记忆的使用
Understanding Is Done Early: A Depth Division of Labor in Large Language Models and Its Use for Unbounded-Context Memory
摘要
Transformer 深度的使用并不统一:下层和中层构建语义表示,而上层越来越多地将它们专门用于预测。我们将这种分工转化为 CoMem(理解记忆),它仅通过中间层写入每个上下文块,检索固定数量的缓存剩余状态,并在结果包上重新计算查询条件的上层。对于固定的检索预算,模型端读取计算和内存与存储的上下文长度无关。我们在统一的无聊天模板协议下评估了持续训练的 Qwen3-8B 基础 LM。脊椎被冻住了;旗舰产品仅在普通 PG19 上训练 32 级自 蒸馏 LoRA,并且我们单独报告了一个无适配器臂。 CoMem 在 RULER 上达到 97.05,在 LoCoMo 上达到 38.27,而全上下文 KV-Direct 为 34.59;对话记忆优势在对话簇重采样和独立判断中仍然存在。其他长上下文和长文档任务的结果揭示了有界检索的好处及其窗口内压缩负担。受控深度扫描表明,更深的缓存会降低每次查询的重新计算量,但会导致保真度损失,而 self-蒸馏 可以大幅修复这一损失。在 128k 的 NVIDIA H20 上进行单独的无适配器效率控制时,CoMem 使用 18.26 GB 而不是 89.36 GB,并实现了 7.83 倍的预填充加速。这些结果表明,长上下文记忆可以沿着层轴组织,而不仅仅是词元轴。