论文
为通过测试而开发:编码Agent可能没有交付用户要求的功能
Building to the Test: Coding Agents Deliver What You Check, Not What You Requested
摘要
基准测试被广泛用于评估LLM任务完成,但测试构造有效性可能有问题,通过测试不一定代表交付了用户所需内容。本文在受控的代码即规范任务中,让两个Copilot CLI Agent(claude-opus-4.7、gpt-5.5)把React Fluent-UI数据表在Angular中重新实现为可复用库,使用隐藏的222项Playwright测试,开展18次运行及三种测试可访问条件。除得分外,作者检查库结构并通过空操作消融核验判断。无法访问测试时,库已生成但尚未完成,得分能反映问题;可在开发中调用测试时,得分接近满分,功能却可能直接写在演示程序里,库本身失去作用或缺失。作者称其为“为通过测试而开发”,并关注Agent是否会像用户一样主动验证交付物。该现象在其他Agent、评估信号和模型家族中的普遍程度仍待研究。