论文
ChurnBench:一个漂移感知基准,展示刷新调度(而不是缓存年龄)控制代理 AI 中的陈旧性
ChurnBench: A Drift-Aware Benchmark Demonstrating That Refresh Scheduling, Not Cache Age, Governs Staleness in Agentic AI
摘要
在生产中,代理系统回答有关存在于多个地方且不断变化的数据的问题:许可证被重新分配、用户离开、价格改变、合同更新。现有的检索基准冻结了数据,因此它们无法询问代理的答案是否仍然正确,而只能询问是否找到了正确的段落。我们推出了 ChurnBench,这是一个开源基准测试,它生成四源企业数据结构作为时间线而不是快照。每个更改都会写入仅附加的 真值 分类帐,并且标准答案是从该分类帐计算的,而不是从实时存储中计算的。因此,在检索数据时正确但在评估时错误的答案会被检测到并标记为新鲜度错误,这与推理错误不同;我们通过在每个报告的案例的两个时间戳处解析 真值 来验证这一点。使用该工具,我们发现当系统按计划刷新时,缓存年龄并不能预测陈旧情况。在 1、14 和 28 天的缓存期限中,新鲜度错误分别为 7、4 和 4,因为计划刷新按生存时间限制过时性,并且在任何窗口中都没有观察到 TTL 失效。受控消融证实了这一机制:禁用分层刷新会使 28 天时的新鲜度错误从 4 个增加到 45 个,并在一天时保持相同。因此,漂移基准测试应扫描的变量是针对每个实体的变化率的 TTL 配置,而不是漂移窗口长度。 ChurnBench、评估工具和所有错误数据均开源发布。