论文

VERA:为Agentic共同进化扩展可验证环境

VERA: Scaling Verifiable Environments for Agentic co-Evolution

智能体系统Agent 环境交互

摘要

有能力的智能体需要精确且可验证的环境,例如可在任何阶段恢复并根据可观察证据演变的沙箱。然而,大多数长期工作都暴露了这些是多么罕见:例如,医学研究中的智能体必须根据发现、对其进行分类,并通过数十个相关步骤撰写报告,但最近的环境仅对结果进行评分。为了解决稳定的训练中的挑战,我们推出了 VERA,它可以大规模构建此类环境,并让智能体在其上发展。 VERA 从初始轨迹构建这些环境:智能体编写规则、可执行文件检查、法官验证每个沙箱,只有通过的沙箱才能进入训练银行。在这些环境中,VERA 在两个更新之间交替:使用标题奖励训练模型,或编辑Harness技能。我们还创建了一个验证器,它使用明确的开发集验收标准来控制模型检查点和Harness编辑。这种归因将 VERA 的协同进化与单轴基线区分开来:它的更新不仅针对原因,而且针对结果。凭借 9,000 多个长范围可验证环境的开源语料库,与其共同进化的智能体配对的 9B 模型在两个领域中比最强基线分别高出 10.3 和 13.0 点。在 27B 时,它超越了 AutoCoWorkBench (71.6) 和 AutoMedBench (80.7) 的基线,转移到未见过的工作流程,并保留了一般功能。

VERA:为Agentic共同进化扩展可验证环境的原论文方法或结果图
图 3:Auto-Rubric 使长工作流程可重新启动和验证。 (1)训练沙箱搭建。每个沙箱都结合了经过验证的环境(工具、工作区和初始状态)、任务查询以及恢复任务所需的交互历史记录。 (2) 标题生成和证据验证。编码智能体从技能配置、工具 API 文档和执行日志生成二进制标题项。每个项目都定义了根据可观察证据在 $\{0,1\}$ 中评分的成功标准。可执行检查验证技能和工具模式。 智能体 Judge 检查轨迹和工作空间,以评估任务上下文中参数的有效性、实际执行效果、工件证据和输出质量。失败的可执行检查会覆盖判断分数。 (3)阶段性和端到端环境综合。基准轨迹分为五个阶段:计划、设置、验证、执行和提交 (S1–S5)。分阶段环境会恢复每个阶段的起始状态并附加相应的查询、历史记录和评分标准,从而允许该阶段独立练习和评分。 端到端环境保留完整的工作流程,而LLM代理模型则模拟耗时的工具调用的响应(Ren 等人,2025)。两种类型都必须通过可执行检查和智能体判断验证才能进入训练银行。环境旁边的数字说明了评分标准。