论文

扩展可验证环境以实现长期工作智能体

Scaling Verifiable Environments for Long-horizon Work Agents

模型训练合成数据

摘要

工作智能体操作数字工件来执行专业知识密集型工作,需要支持长视野交互和值得信赖的验证环境。然而,手工制作的环境会产生过高的工程开销,从而阻碍环境扩展,而综合方法则牺牲了工作空间的复杂性、真实性或基础可验证性。为了弥补这一差距,我们引入了 WorkForge,这是一个可扩展的综合框架,用于从现实世界的资源构建可验证的工作智能体环境。从专家工作流程开始,WorkForge 首先确定每个工作流程所需的资源、决策和可交付成果。然后,它检索相关的现实世界文件并将它们组织到工作区中。 WorkForge 检查工作区以提取有关其内容的具体、可检查的事实。这些事实锚定了工作空间可以支持哪些任务类型以及如何验证其结果。因此,WorkForge 直接从这些事实锚点导出每个任务的说明、解决方案计划以及补充的程序和语义验证器,使验证可追踪到可观察的工作空间证据。此外,我们构建了跨 40 个专业领域的 16.7K 个可验证环境,工作空间总共涵盖 60 种文件类型。 后训练 Qwen3.5-35B-A3B-Base将GDPVal从45.5提高到73.6,将APEX Score从5.0提高到21.3,同时使Qwen3.5-27B获得极具竞争力的性能并超越强大的竞争对手。我们的分析证实了所提出方法的有效性,并揭示了跨数据量和交互范围的一致扩展行为。

扩展可验证环境以实现长期工作智能体的原论文方法或结果图
图 2:WorkForge 管道概述。以专业场景蓝图为条件,WorkForge 获取现实世界资源并将其实例化到真实的工作空间中,派生任务和补充验证器,并通过交互收集评分轨迹。