论文
Doc-to-Atom:学习编译和组合内存原子
Doc-to-Atom: Learning to Compile and Compose Memory Atoms
摘要
长输入序列对于 大语言模型 中的文档理解和多步推理至关重要,但注意力的二次成本使得推理既占用内存又缓慢。上下文 蒸馏 通过将上下文信息压缩到模型参数中来缓解这一问题,而最近的工作(例如 Doc-to-LoRA)将上下文 蒸馏 分摊到单个前向传递中,该前向传递为每个文档生成一个 LoRA 适配器。然而,为所有查询生成单个整体适配器会导致不相关的查询干扰、有限的组合召回以及长文档推理的可扩展性较差。为了应对这些挑战,我们提出了 Doc-to-Atom (Doc2Atom),这是一种组合参数存储框架,可将每个文档分解为语义类型的知识原子。每个原子都被编译成一个独立的微型 LoRA 适配器和一个来源检索密钥。在推理时,轻量级查询路由器仅选择相关原子并将其组装到特定于查询的适配器中,然后将其注入到冻结的基础模型中。整个系统通过多目标 蒸馏 框架进行端到端训练。对六个不同 QA 基准的实验表明,Doc2Atom 的性能优于 Doc-to-LoRA 基准,同时降低了文档内化的内存成本。