论文
使用内存进行推测:LLM 代理的无损加速
Speculate with Memory: Lossless Acceleration for LLM Agents
摘要
推测执行通过使用更小、更便宜的模型在环境空闲时预测和预启动下一步来加速 LLM 代理。然而,现有的投机者是无状态的,并且会丢弃任务之间的所有信息,从而阻止预测质量随着经验而提高。我们为投机者配备了三个在线记忆系统,可以从过去的智能体轨迹中学习:一个跟踪动作序列统计数据的对比转换表、一个检索上下文相似片段的情景记忆,以及一个抑制重复错误的混淆跟踪器。我们在涵盖三种推测类型的六个基准上评估这种方法:动作预测、观察预测和链式预测。记忆增强推测使动作预测的相对准确度提高了 19--39\%,并且在具有重复动作空间的观察预测任务上提高了高达 2.5\times$。随着记忆的积累和在不同成本的投机者模型中的推广,这些收益不断增长。所有推测都是无损的,因为它在空闲时间内以零附加挂钟成本运行,并且参与者的轨迹与非推测执行相同。