论文
ExpHarness:通过可训练的 Harness 进行与模型无关的体验学习
ExpHarness: Model-Agnostic Experience Learning through a Trainable Harness
摘要
大语言模型 (LLM) 代理越来越多地在Harness中操作,Harness是决定什么进入执行者上下文的脚手架,但他们在任务中积累的经验很少回流到该Harness中。现有方法包括执行器 微调 和外部存储器检索,但将任务自适应检索与跨冻结执行器的经验重用相结合仍然具有挑战性。为此,我们引入了 ExpHarness,这是一种可学习的体验工具,可在不修改参数的情况下改进冻结和可替换的 LLM 执行器。具体来说,ExpHarness 将轨迹提炼为可重复使用的技能和自我进化的经验图中的失败教训,并训练一个轻量级的检索副驾驶,该副驾驶员根据任务决定探索图的范围,以及在多大程度上偏爱历史上有用的经验而不是类似的经验。副驾驶通过基于效用的奖励的强化学习进行优化,结合有/无经验分数差异和绝对绩效项;训练期间相同的奖励会更新图表。在 ExpSuite 上进行的广泛实验(涵盖 10 个静态基准测试和 2 个代理环境)表明,ExpHarness 在静态任务上比最强基线提高了 12.1% 和 4.5%,在较小和较大执行器的代理任务上分别提高了 21.4% 和 12.7%,同时减少了高达 21.6% 的交互步骤。迁移实验进一步检查了不同规模和推理能力的执行器之间所学习的工具的重用,在评估的迁移变体中,联合图和副驾驶迁移的表现最接近特定于目标的训练。