论文

RefactorPlatform:用于存储库规模重构代理的受控评估的开源工具

RefactorPlatform: An Open-Source Harness for Controlled Evaluation of Repository-Scale Refactoring Agents

智能体系统Agent任务评测

摘要

存储库规模的重构需要 编码智能体 在许多相互依赖的文件中传播单个更改,而不改变程序行为,但据我们所知,没有现有的工具能够隔离决定代理在此任务上成功的设计选择。我们提出了 RefactorPlatform,这是一个开源评估工具,它保持环境固定并显式地改变每个设计轴:模型主干(通过 OpenRouter 和 GitHub Copilot CLI)、执行机制(基线、检索增强和多代理)和提示特异性。每次运行都在一个独立的工作空间中执行,具有实时终端流、每个任务的标记、差异和转录本记录、基于 AST 的验证以及用于审核和复制的可导出遥测数据。我们在四个模型系列的 100 个多文件 RefactorBench 任务上演示了该平台,并说明了它支持的分析:在提示模式下,AST 感知分块比朴素词元窗口分块高出 25-30%,而朴素检索则低于无检索基线;精益检索增强型单一代理 (86%) 击败了我们在匹配任务上评估的子代理配置 (66%),没有任何任务在委托下传递且检索失败;检索的准确性增益吸收了其词元开销,使每次成功重构的成本保持不变。 RefactorPlatform 是开源的,使重构代理评估可重复且可审计。