LLM 可以在没有代码的情况下修复它吗?实现无代码错误修复的自动验证
Can LLMs Fix It Without Code? Toward Automated Verification of No-Code Bug Fixes
摘要
无代码修复通过指导用户更改设置、更新到问题已修复的版本或调整其工作流程来解决无效的错误报告。手动验证提议的无代码修复是否可以解决报告的错误需要开发人员花费大量时间。本研究提出了一种基于执行的自动化管道,用于评估大型语言模型 (LLM) 在真实浏览器环境中生成无代码修复的能力。我们评估了根据先前研究的基准发布的 12 个配置生成的 322 个无代码修复,涵盖分类为错误配置、错误版本或外部系统和依赖项的错误报告。执行器代理按照其自然语言指令应用每个修复,并且特定于问题的检查器确定报告的错误是否仍然存在。我们使用三个执行器重复该管道:两个计算机使用代理 OpenCUA-72B 和 Claude Sonnet 5,以及一个多模式 agentic LLM、Meta 的 Muse Glimmer。只有 17.6% 的候选问题能够成立并通过两个理智门。跨越 322 个修复,14.6% 到 49.7% 解决了错误,具体取决于执行器,而最强的配置,Vanilla 管道中的 Claude Opus 4.6,在 Claude Sonnet 5 下解决了高达 74.1% 的修复。仅更改执行器,配置的解决率平均改变了 38.8%,三个执行器仅对 46.9% 的解决方案达成了相同的结论。修复。与人类执行相比,执行者在 66.1% 到 88.1% 的采样修复中与人类共识一致。即使在最好的执行器下,LLM 生成的无代码修复中也只有不到一半能够解决报告的错误,因此此类修复在到达用户之前需要进行验证。基于执行的验证可以提供这一点,但测量的能力在很大程度上取决于执行器,评估必须报告和控制执行器。