论文
CUA-SWE:联合评测代码修改与GUI验证的软件工程Agent
CUA-SWE: When Computer-Use Agents Meet Visual Software Engineering
摘要
软件开发需要的不仅仅是编辑代码:开发人员重复运行软件,与其界面交互,直观地检查其行为,并使用这些观察结果来决定下一步要更改什么以及更改是否有效。现有的编码Agent和计算机使用Agent在很大程度上是孤立研究的,而这种集成开发过程尚未得到充分探索。诊断运行时交互故障需要Agent将视觉观察与负责的代码连接起来,然后再次使用应用程序来验证修复。我们介绍 CUA-SWE,它是计算机使用的软件工程的基准、环境和评估管道。除了研究 GUI 反馈如何支持诊断和修复之外,我们还询问当仅通过运行应用程序的可视界面提供所需的规范或操作信息时,Agent是否可以完成软件工程任务。 CUA-SWE 跨越四个软件工程领域,要求Agent在同一任务中修改代码和配置、执行命令、与正在运行的软件交互以及检查视觉反馈。每个任务都包括确定性的、特定于任务的测试,以验证生成的软件是否满足要求并保留指定的行为。我们的评估描述了前沿Agent如何将源代码级执行与应用程序屏幕截图和图形交互相结合以产生经过验证的软件更改。我们检查跨领域的性能和任务信息要求,以及与成功修复相关的开发行为。 CUA-SWE 提供了一个统一的测试平台,用于研究Agent如何使用视觉反馈和交互来指导软件工程,并为生成的软件提供可执行的正确性标准。