论文

VRL-Bench:在有限试错预算下对智能体在计算机控制任务中的表现进行基准测试

VRL-Bench: Benchmarking agents on computer control tasks under finite trial budgets

智能体系统上下文与知识记忆Agent任务评测Agent记忆

摘要

通过试错学习是提升语言智能体在复杂任务(如计算机控制)中表现的一种有前景的方法。Reflexion提出了言语强化学习,将失败的试错转化为文本,以指导后续尝试,而无需更新模型参数。我们提出了VRL-Bench,一种用于在有限试错预算下公平评估试错学习的工具。在MiniWoB和WebShop的三个模型上,我们评估了多种主流言语-记忆方法(包括Reflexion及其后续工作)的更新效果:在某些场景下,这些方法在观察到的成功率上优于无记忆的重试,但在其他场景下则降低成功率。回放实验表明,使用反思会降低成功概率,揭示了在利用经验与持续探索之间存在的权衡。我们提出了VEX²,一种基于语言模型的言语探索-利用调度器,可联合选择策略并分配剩余试错预算。VEX²是唯一在六个场景中均实现比重试更高的观察成功率达到提升的更新方法。