论文

Meta-TTL:语言代理的元学习自我改进策略

Meta-TTL: Meta-Learning Self-Improvement Policies for Language Agents

智能体系统Agent 架构与控制循环

摘要

测试时学习 (TTL) 使语言代理能够通过在推理时与环境重复交互来迭代地改进其性能。 TTL 的核心是自我改进策略,它根据之前的经验更新参与者策略,从而改善未来的行为。现有的方法依赖于手工的自我改进,而不是针对下游改进进行优化。我们认为,最佳的自我完善政策应该从任务环境中学习,而不是根据人类直觉手工设计。为了实现这一目标,我们引入了 \textbf{Meta-TTL},一个将有效自我改进策略的发现制定为双层优化问题的框架。在此框架内,内部循环执行标准 TTL 过程,衡量候选自我改进策略如何有效地帮助代理纠正连续事件中的错误。在代理性能的指导下,外循环在不同的训练任务中执行反射元训练,使用平衡改进分数(BIS)来平衡候选选择期间的任务贡献。我们在 Jericho、WebArena-Lite 和 -bench 上跨发行版内 (ID) 和发行外 (OOD) 设置评估 Meta-TTL。 Meta-TTL 始终优于现有基线,在 ID 任务上将 TTL 比最强基线提高了 23%,在 OOD 任务上将 TTL 提高了 27%。这些结果表明,优化的自我改进策略编码了可转移的元策略,这些策略可以推广到训练任务分布之外。