论文
VERA:为Agentic共同进化扩展可验证环境
VERA: Scaling Verifiable Environments for Agentic co-Evolution
摘要
有能力的智能体需要精确且可验证的环境,例如可在任何阶段恢复并根据可观察证据演变的沙箱。然而,大多数长期工作都暴露了这些是多么罕见:例如,医学研究中的智能体必须根据发现、对其进行分类,并通过数十个相关步骤撰写报告,但最近的环境仅对结果进行评分。为了解决稳定的训练中的挑战,我们推出了 VERA,它可以大规模构建此类环境,并让智能体在其上发展。 VERA 从初始轨迹构建这些环境:智能体编写规则、可执行文件检查、法官验证每个沙箱,只有通过的沙箱才能进入训练银行。在这些环境中,VERA 在两个更新之间交替:使用标题奖励训练模型,或编辑Harness技能。我们还创建了一个验证器,它使用明确的开发集验收标准来控制模型检查点和Harness编辑。这种归因将 VERA 的协同进化与单轴基线区分开来:它的更新不仅针对原因,而且针对结果。凭借 9,000 多个长范围可验证环境的开源语料库,与其共同进化的智能体配对的 9B 模型在两个领域中比最强基线分别高出 10.3 和 13.0 点。在 27B 时,它超越了 AutoCoWorkBench (71.6) 和 AutoMedBench (80.7) 的基线,转移到未见过的工作流程,并保留了一般功能。
