论文
通过目标端读卡器适配进行跨模型内存传输
Cross-Model Memory Transfer via Target-Side Reader Adaptation
摘要
改进 大语言模型 中知识使用的方法通常分为两种方式。非参数检索提供了对外部知识的灵活访问,但增加了检索延迟、上下文开销,并且仅与主干网进行浅层集成。参数适应在推理时非常有效,但将知识与模型权重纠缠在一起,并且可能难以更新、审核或转移。印迹式散列内存占据中间状态:它将学习到的信息存储在外部可寻址表中,但通过小型学习读取器消耗该表。这就提出了一个基本问题:当这样的内存跨主干移动时,冻结的内存本身还是目标端读取器哪个更重要?我们通过跨模型冻结内存提取来研究这个问题,其中在源模型上训练的内存被冻结并附加到不同的目标模型,仅训练轻量级读取器。消融表明,学习的记忆内容和正确的寻址都很重要,但转移表只有通过与目标模型对齐的读取器才变得有用。在下游问答任务中,双层四分支阅读器几乎缩小了同模型和跨模型重用之间的差距,在我们的受控评估协议下获得了 38.8 的平均分数。此外,当提供者读取器与目标接口直接兼容时,冻结的工件可以在无需目标端训练的情况下提供大量实用性,而可选的读取器适应则可以产生进一步的改进。这些结果表明,只要目标能够访问兼容的阅读器接口,Engram 就可以充当可重用的外部知识工件;当直接读取器重用不足时,目标端适应可以进一步改善对齐。