论文
VibeMemBench:在实际存储库编码任务中评估编码代理的内存系统
VibeMemBench: Evaluating Memory Systems for Coding Agents on Real Repository Coding Tasks
摘要
编码代理在真实的存储库编码任务上运行,持久内存系统承诺跨任务重用经验。然而现有的评估并没有表明这些系统是否改善了可执行存储库的工作。存储库基准测试代码更改,但不隔离内存,而内存基准测试对召回率进行评分,而不测量下游编码结果。我们引入了 VibeMemBench,这是一个针对来自 90 个 SWE-rebench V2 存储库的 111 个编码目标和来自目标存储库的 3,634 个历史轨迹评估内存系统的基准。这些目标遵循 SWE 基准测试风格,涵盖错误修复、功能请求、界面更改和配置工作。代理在声明的内存条件下编辑每个目标代码库。可执行的测试决定任务的解决。仅当注入的历史经验在参考设置中改善其可执行结果时,每个目标才会被保留,因此每个目标都带有先前的经验,其有用性通过在该设置中的执行来验证。然后将冻结的验证经验转移到五个保留的求解器。直接注入将其中 4 个任务的观察到的任务分辨率提高了 1.1 至 4.5 个百分点,同时降低了所有 5 个任务的代理步骤。然而,当四个现有的记忆系统必须从同一历史中构建和检索经验时,十二个解算器和系统配对中的十一个未能超过匹配的记忆关闭基线。 VibeMemBench 揭示了存储库历史记录所保留的有用体验与现有内存系统为存储库编码任务提供的体验之间的差距。