论文
LatentHarness:通过反事实策略蒸馏学习记忆和推理的潜在行为
LatentHarness: Learning Latent Actions for Memory and Reasoning via Counterfactual Policy Distillation
摘要
长上下文推理面临两个互补的瓶颈:在长输入中保留证据和在许多推理步骤中维持计算。现有的方法主要是单独解决这些问题,通过外部存储器扩展对远程证据的访问,并通过潜在推理压缩多步骤计算。我们引入 LatentHarness,它将内存访问和潜在推理统一为顺序潜在动作选择。在每个内部步骤中,模型选择 THINK 进行进一步计算,从输入证据和中间推理状态的快速权重存储器中进行 RECALL,或者选择 EXIT 发出下一个标记。我们通过反事实策略蒸馏来训练这一策略,它将每个动作分支为一个步骤,并对其对发出的词元的影响进行评分。这些收益教导了记忆何时比进一步推理更有用的策略,而通过反事实回忆的梯度教导哪些中间状态应该保留在记忆中以供将来使用。在六个通用和长上下文推理基准测试中,1.4B 的 LatentHarness 相对最强基线分别提高了 2.8% 和 10.0%,并且运行速度比最强长上下文基线快 5.9 倍。