论文

现在学习,下一步使用,稍后信任:LLM Agent的考前学习

Learn Now, Use Next, Trust Later: Prequential Test-Time Learning for LLM Agents

智能体系统智能体自我改进

摘要

在部署过程中调整大语言模型Agent不仅需要保留过去的经验,还需要将新的观察结果转化为及时的指导。然而,许多测试时学习方法都是从已完成的片段中获取知识。因此,来自正在进行的交互的反馈可能无法足够快地提炼成知识来帮助下一个决策。在个体转换的粒度上获取知识可以减少这种延迟,但会带来一个单独的挑战:在一个情节中有用的规则可能不足以可靠地指导未来的情节。等待验证可能会丧失直接的好处,而不受限制的重用可能会传播意外或错误的指导。我们引入了 StepLearn,这是一个非参数框架,它将立即使用与持久信任分开。它将信息转换转变为可以指导下一步的假设,同时需要在跨情节重复使用之前进行前瞻性验证。他们的预测效果会根据源事件之外的后续观察进行检查,并且只有得到充分支持的假设才可用于持续指导。此过程更新外部知识,同时保持所有模型参数固定。在 WebArena-Lite 和 ALFWorld 上的五轮比赛中,StepLearn 使用 GPT-5-mini 的平均成功率分别为 59.9% 和 84.0%,使用 Qwen3.5-35B-A3B 的平均成功率分别为 57.8% 和 88.1%。在四种设置中,它的性能比最强的基线 EvoTest 高出 2.2-12.7 个百分点。学习动态进一步表明,这些收益并不局限于最终的重复,在大多数情况下,在第一次任务尝试中已经存在优势。