论文
RigorBench:自主人工智能中的工程流程学科基准测试 编码智能体
RigorBench: Benchmarking Engineering Process Discipline in Autonomous AI Coding Agents
摘要
代理编码工具(例如 Agent-Skills、Superpowers 和 Agent-Rigor)越来越多地被部署来增强底层 LLM,以完成实际的软件工程任务。现有的基准测试几乎完全根据结果的正确性来评估这些代理:生成的代码是否通过测试或解决问题。我们认为,这种只注重结果的视角是不够的:通过鲁莽的试错、没有计划、验证或优雅恢复而得出正确解决方案的智能体,从根本上来说不如遵循健全的工程纪律的智能体可靠。我们推出 RigorBench,这是第一个旨在衡量 AI 编码智能体 中流程纪律的基准。 RigorBench 从五个支柱评估这些工具:规划保真度、验证覆盖率、恢复效率、弃权质量和原子转换完整性。复合 RigorScore 通过加权总和将这些维度聚合为单个指标。我们策划了一套涵盖 5 个类别的 30 项任务 - 计划然后构建、验证或死亡、末日循环挑战、知道何时折叠和不要破坏构建 - 并根据基线编码助手在有/无实验设计的受控情况下评估领先的工具。我们的结果表明,结构化流程规则不仅将流程质量得分平均提高了 41%,而且还将下游结果的正确性提高了 17%,这提供了第一个定量证据,证明代理的编码方式与其生产的内容同样重要。我们以开源工件的形式发布了完整的基准测试、评分标准和轨迹分析工具。