论文

ProgramDistill:从可交互Web应用构建可验证的编码任务

ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks

智能体系统Agent任务评测

摘要

编码代理通常通过问题或指令指定的期望行为进行评估。然而,在实际的 Web 开发中,代理可能需要从工作软件推断行为并在不完整的应用程序中实现它。我们引入了 ProgramDistill,这是一个基准测试,用于评估编码代理通过与功能齐全的参考应用程序交互发现的功能。我们通过将应用程序分解为不同粒度的功能来构建 ProgramDistill,每个功能都与可通过其黄金补丁执行的可重播行为相关联。我们的管道“mine-craft-patch”在 26 个应用程序中发现了 1,975 个经过重放验证的行为,并在无需人工干预的情况下构建了 4,063 个任务。在九种前沿编码代理中,GPT-6 Astra 和 Claude Opus 5 在全应用重建的累积工作流程上取得了 49.2% 和 28.8% 的成功。在部分应用重建中,随着恢复深度从 1 增加到 8,成功率从 100% 下降到 64.0%,从 96% 下降到 32%。因此,ProgramDistill 为评估和诊断编码代理提供了一个难度可控的可扩展基准,并为未来基于课程的训练提供了自然基础。