论文
轨迹检索推测解码:模型自己的历史何时有用?
Trajectory-Retrieval Speculative Decoding: When Does a Model's Own History Help?
摘要
长的思维链推理增加了顺序解码成本,同时创造了潜在可重用延续的不断增长的历史。我们会调查这段历史何时提供有用的草稿并补充现有的起草者。受控源比较揭示了轨迹特定的重用,激发了我们的方法轨迹局部自适应检索(TLAR)。 TLAR 从当前轨迹检索近似匹配的延续,并使用最近的验证结果来调整检索激活和候选宽度。 TLAR 将检索到的延续与共享候选树中模型生成的草稿相结合,通过精确的验证保留目标模型的输出分布。在代码调试、数学和开放式写作方面,我们的评估将源代码重用、增量接受和执行成本联系起来。将 TLAR 与强大的检索基线相结合,可以提高匹配的验证预算下的 token 接受度,并提高草图模型基线上的端到端吞吐量。这些发现支持将生成的轨迹作为运行时记忆进行自适应推理。