论文
Vestrum:通过调整验证、结构和记忆改进Agent Harness
Vestrum: Improving Agent Harnesses by Adapting Their Verification, Structure and Memory
摘要
Agent Harness控制语言模型如何访问信息、使用工具、保留内存以及检查其工作。当每次评估都需要与环境进行长时间交互时,改进该软件的成本很高。我们引入了 Vestrum,这是一个框架,可以将执行跟踪中的失败转化为范围内的Harness更改,而无需训练任务模型。它的组织框架的上层假设是,共享类型的任务可能会反复出现失败,而其补救措施会在该类型中转移。 Vestrum 将失败表示为可识别的类,提出验证、检索、分解和知识合成方面的更改,并在将它们作为一个包进行评估之前筛选其范围。持久的经验教训文件为后续建议提供了信息。在五种设置和两个基线Harness中,冻结后不再更新的Harness提高了留出集表现:UltraHorizon 比 GAM 从 47.6 上升到 59.8,Terminal-Bench 4 Hard 在 8 个保留任务上通过 Claude Code 的检查以 1.03 倍的测试成本从 63.7% 上升到 70.3%,一张切片的留出区域的细胞类型注释一致性从 67.5% 上升到 77.8%,同时LoCoMo 和 AMA-Bench 的收益。在我们的搜索中,基于证据的验证有助于中间步骤和最终答案,中间步骤的成本较低,而批评者要求重建最终答案的破坏多于他们修复的答案。在三个内存基准测试中,Vestrum 的得分也高于每次配对评估中评估的 GEPA 配置。