论文
Anchor:缓解智能体基准生成中的产物漂移
Anchor: Mitigating Artifact Drift in Agent Benchmark Generation
摘要
AI智能体已开始能完成有价值的长程业务运营任务,但面向企业工作的训练与评估环境仍难以在真实性、可验证性与规模之间取得平衡。环境与任务创建常常遭受一种我们称之为产物漂移(artifact drift)的失效模式:当指令、环境、标准答案与验证器由松耦合流程创建时,它们对任务要求的理解常常不一致,从而产生无解、可被奖励劫持或自相矛盾的环境。我们提出Anchor,一个将领域专家对业务工作流的规格说明形式化为约束优化程序的任务生成流水线。从单一参数化规格出发,该流水线联合生成自然语言指令、环境配置、经求解器认证的真值解以及基于状态的验证器。借助Anchor,改变参数即可生成难度可控且最优解已知的任务,产出与测试框架无关的环境,其奖励仅取决于最终状态的业务正确性。我们将Anchor应用于构建ERP-Bench:一个包含300个长程任务的基准,覆盖生产级ERP系统中的采购与制造工作流。我们发现生成参数能够预测实际难度,并且前沿模型在26.1%的试验中满足显式任务约束,但仅在17.4%的试验中达到完全最优解。总体而言,我们表明Anchor与ERP-Bench为经济价值高的智能体工作构建可审计评估环境提供了具体方案。我们在erpbench.ai发布任务生成器与ERP-Bench数据集。
