论文
为长时域Agent自行设计的评估器和温暖记忆
Self-Designed Evaluators and Warm Memory for Long-Horizon Agents
摘要
部署在长流任务上的使用工具的语言模型Agent不会收到任何奖励,因此它无法判断是否成功,无法安全地重试,也无法标记需要改进的体验。我们提出了 SelfSuite,其中智能体自己的基本模型,仅给定世界上的公共材料,设计了一个由加权评审和grounding的每个任务摘要组成的小型评估套件,将其冻结,并使用它来门控保持最佳重试并标记类型化的、结果跟踪的记忆。在 tau2-bench 和 AppWorld 上匹配的五次重复基准测试中,SelfSuite 的得分高于没有任何标签的普通Agent,匹配 tau2-bench 上给出的十个专家标签的方法,并在 AppWorld 上跟踪 Agentic 上下文工程 (ACE),其中代码执行给出直接的成功信号。在针对相同任务运行的消融活动中,每次重复中它都高于无标签 ACE,并且门控第二次尝试是唯一在每次重复中移除都会造成伤害的组件。我们还模拟了一位主题专家,他对每个世界的十个入职任务进行评分。使用这些标签来校准 SelfSuite 的评估器会产生小而一致的增益,并使用它们来预热 ACE 的记忆,从而提升 ACE 与校准后的 SelfSuite 的联系。对第二个模型系列的单次研究显示了相同的顺序。