论文
MemoryAthena:潜在内存和生成内存的自适应路由
MemoryAthena: Adaptive Routing over Latent and Generated Memories
摘要
学习记忆方法将信息存储在显式表中,并通过单独的读取器使用它,从而允许独立修改寻址、存储和读取。我们研究是否也可以生成有用的记忆而不仅仅是检索。 MemoryAthena 使用三种途径:直接印迹检索 (E)、从检索到的印迹线索生成 (GE) 以及在不查阅记忆表的情况下从因果骨干状态生成 (GH)。生成的记忆是有条件地有用的:它可以在一种情况下补充 E,但在另一种情况下干扰它。因此,MemoryAthena 将 E 视为锚点,并学习生成的表示何时应进行干预。在主干、内存、生成器和读取器冻结的情况下,根据 GE 和 GH 相对于 E 的反事实未来词元似然优势来训练轻量级因果路由头。在推理时,被承认的候选者通过有界插值修改 E 残差,而拒绝则准确地恢复直接路径。在问答方面,MemoryAthena 将同一检查点直接路径上的五项任务平均值从 37.65 提高到 39.28,而六项任务一般 NLP 平均值从 76.73 提高到 79.13。完整的内存端系统包含大约201M参数,不包括冻结的主干。进一步的分析表明,E、GE 和 GH 在任务和投入方面具有互补优势。这些结果支持生成记忆作为直接检索的选择性校正,并突出路由何时、何种程度以及如何强烈地进行干预作为核心挑战。