论文

从死代码和静态需求到工作引擎:通过编码Agent实现软件复兴

From Dead Code and Static Requirements to Working Engines: Software Revival with Coding Agents

智能体系统Agent任务评测

摘要

编码Agent能否在保留其底层方法的同时恢复不再运行的软件,并根据开放规范重建工业软件引擎?在这里,我们介绍 ReviveBench,这是一个包含两个任务系列的基准测试,由针对本机执行环境、已建立的工程工具或专门构建的参考实现进行校准的隐藏验证器进行评估。复兴系列包含十项任务,涉及依赖性不兼容性、删除的核心模块、遗留版本和基于 GPU 的基础模型。每个起始工作区均未通过验证,并且最强大的评估模型在每个任务中至少运行一次即可通过所有十项任务。在污染控制实验中,标识符混淆将与原始实现的线路相似度从 0.51--0.96 降低到 0.03--0.44,而不会降低任何评估模型的观察到的通过率。在规定的知识截止后创建的存储库中,最强的模型通过了九次运行中的八次。重建系列包括十三个任务,涵盖数字、几何、硬件和事务系统(例如 CAD 和 CRM)。尽管我们的审计表明 CFD 任务无法建立数值求解器能力,但有两个模型满足所有 13 个模型的基准通过标准。基准构建和审计发现了 28 个验证程序缺陷,其中包括 24 个误报和 2 个误报。这些发现表明,可执行验证本身可能会引入严重的测量误差。我们提出了三个实际检查:测试规定的方法是否可以达到评分阈值,调查独立生成的候选者之间的一致性,以及根据提交的工件重新计算诊断。 ReviveBench 因此提供了软件复兴和引擎重建的评估,以及验证用于测量软件设计编码Agent的验证器的案例。