论文

提炼经验改进LLM智能体的测试时推理

Decocted Experience Improves Test-Time Inference in LLM Agents

上下文与知识上下文工程

摘要

在不更新模型参数的情况下改进LLM正日益受到关注。一个成熟的方向是测试时扩展(test-time scaling),即利用增加的推理时计算(如更长推理、采样或搜索)来提升性能。然而,对于复杂推理与智能体任务,天真地扩展测试时计算会大幅增加成本,且仍可能把预算浪费在次优探索上。本文探索将上下文(context)作为提升LLM性能的互补扩展轴,并系统研究如何通过经验(experience)构建更好的输入来引导推理。我们表明,有效的上下文构建关键依赖于提炼的经验(decocted experience)。我们对经验增强的智能体进行了细致分析,研究如何从经验导出上下文、性能如何随经验积累而扩展、好上下文有何特征,以及哪些数据结构最能支持上下文构建。我们将提炼的经验确认为有效上下文构建的关键机制:从经验中提取精华、连贯地组织,并检索突出信息以构建有效上下文。我们在包括数学推理、网页浏览与软件工程在内的推理与智能体任务上验证了这些发现。

提炼经验改进LLM智能体的测试时推理:论文配图
图 1:体验增强代理。智能体从过去的交互中积累经验,将其转化为有效的上下文,以在测试时改进推理,即从经验中提取教训,组织经验记忆,最后从中检索显着信息。