论文

WatchPoint:现实世界代理 Web 开发的可执行用户反馈

WatchPoint: Executable User Feedback for Real-World Agentic Web Development

智能体系统Agent 环境交互

摘要

当专业 Web 开发人员的代码未通过测试时,他们不会简单地重新读取堆栈跟踪。他们在浏览器中打开应用程序,单击按钮,检查计算样式,并运行诊断命令以了解出了什么问题。编码代理的现有反馈机制依赖于屏幕截图、LLM 作为法官评分或自然语言更正,但很少有像开发人员那样与实时应用程序交互的方式。我们引入了 WatchPoint,这是一个模拟用户系统,它通过针对正在运行的应用程序生成和执行诊断脚本来模仿真实的开发人员行为,生成指导编码模型重试的结构化观察结果。与之前针对单文件编辑或使用不可执行指标进行评估的方法不同,我们在 Web-Bench 上运行,这是 50 个多文件 Web 项目的基准,其中包含 1,000 个顺序相关的任务,并通过确定性端到端测试进行验证。 WatchPoint 恢复了 57.6% 的诊断任务,一项受控用户研究证实了模拟的真实性:人类测试人员实现了相当的恢复率 (54.5%),这提供了证据表明自动化诊断脚本可以替代顺序 Web 开发任务上的交互式人类测试。我们进一步确定了一种能力差距模式,该模式控制模拟用户反馈何时有用以及何时应保留。