论文
DreamBench-SWE:面向软件智能体的多会话记忆卫生基准
DreamBench-SWE: A Multi-Session Memory-Hygiene Benchmark for Software Agents
摘要
DreamBench-SWE是一个面向软件智能体记忆卫生的多会话基准,其中后续软件任务依赖来自更早会话的不可推断证据,并由可执行的隐藏oracle评分。我们报告原始的规模化v2折,以及一个按该研究设计、但在检查后继结果之前冻结的独立预注册v2.1后继审计。后继运行在四个条件下完成了360/360个工作单元和720/720个S3单元格。在原始折中,主要的DF-hybrid对B5比较为无效结果(95/180对89/180;聚类p=.518,Holm p=1),并非等价性的证据,且C9/C10保留了B0余量限制。在后继中,无外部记忆达到21/180通过(比率0.1167),确定性逐字事件记忆82/180(比率0.4556),类型化加原始参考探针83/180(比率0.4611),一个固定的托管Mem0字面存储配置97/180(比率0.5389)。预注册的六槽Family A以p=1保留不可用槽;针对无记忆的全部三个可用比较在Holm校正后被拒绝。两个预注册的机制比较在预评估一致性拒绝后不可用。次要的字面存储对比逐字的比较不具确认性且依赖敏感性,而与参考探针的比较未拒绝。因此,该审计支持DreamBench-SWE作为一个有区分力的可执行画像基准,并刻画了一个确切的托管记忆配置,但它并未确立外部系统机制、记忆承载条件之间的优越性、等价性或广泛的产品普适性。原始v2.0.5的发现与工件保持不变。