论文
推理努力,而不是工具访问,购买了代理代码生成的首次尝试可靠性:一项观察性研究
Reasoning effort, not tool access, buys first-try reliability in agentic code generation: an observational study
摘要
代理编码助手越来越多地被赋予额外的功能,例如基于浏览器的测试工具和面向设计的系统提示,假设更多的功能会产生更好的软件。这项研究直接检验了这一假设。九十个独立代理运行构建了相同的应用程序,一个实时回顾板,根据一个详细的规范,每个人都根据固定的 14 个标准功能评分标准(最多 42 分)和视觉质量审查进行评分。运行跨越了几代模型、两个代理工具、两个推理工作级别、一个测试工具和两个面向设计的提示。能力层占主导地位:前沿模型聚集在上限附近,而低成本本地模型则跌至 24 至 37 点。标准水平分析揭示了运行总数所隐藏的内容。容器部署是主要缺陷,在 44% 的运行中首次尝试失败,其失败率在各代模型之间急剧变化,而平均总数变化不到一个点。该测试工具将成本提高了 42% 至 68%,但没有提高功能分数或可靠性,即使按照界面可见标准也是如此。将推理努力从高提高到 xHigh 将首次尝试完美运行率从 28% 提高到 89%,并将纠正提示减少约五倍,成本增加 9% 到 29%。面向设计的提示提高了视觉质量,5 分制中 4.5 与 3.0,没有提升功能,其指令的一段释义再现了整个提升。实际的教训是将修复与失败相匹配:大多数首次运行失败来自弱推理,更强的模型或更多的努力可以防止这种情况,而不是检查工具可以捕获的可见缺陷。