论文
LIMBO:LLM 代理的终身推理时间内存和预算优化
LIMBO: Lifelong Inference-Time Memory and Budget Optimization for LLM Agents
摘要
随着大语言模型代理人融入日益复杂的工作流程,他们必须不断获得新的能力,同时保留以前学习的任务的能力。终身代理通过经验重放来解决这个问题,将过去的交互注入提示中,以在推理过程中利用先前的经验。然而,重放并不是免费的:每个重放的轨迹都会与检索、推理、工具使用和验证竞争,以获取相同的有限提示和计算预算,因此有效的资源分配至关重要。现有方法使用固定重放策略来分配这些资源,而不管重放是否对当前任务有利。我们将其识别为推理时间内存分配,这是终身智能体的一个独特问题类别,并引入 LIMBO:据我们所知,第一个在线框架,它将内存视为可控的推理时间资源,并联合优化每个传入任务的内存策略和推理预算。与之前固定重放策略或需要模型权重、教师监督或离线再训练的方法不同,LIMBO 在单次在线中学习这种分配,显式地平衡任务性能和推理成本,而无需修改底层代理。在 LifelongAgentBench 上的三个 LLM 主干中,LIMBO 实现了比最先进的内存增强基线更好的成本精度权衡,并且几乎与所有最强的此类基线相匹配,推理成本降低了约 83%(平均约 53%)。 LIMBO 无需重新训练即可跨模型和环境调整其策略,这表明可以在线学习有效的分配,而不是手动指定。