论文

AgentIR:用于长期会话记忆的工作负载自适应级联检索基底

AgentIR: A Workload-Adaptive Cascade Retrieval Substrate for Long-Term Conversational Memory

上下文与知识记忆Agent记忆

摘要

长期会话记忆是一种检索工作负载,经典 IR 并非为此而构建:索引在查询流期间增长,查询类型在会话内发生变化,每次检索的延迟预算低于 10 毫秒。 Lucene 类引擎将索引视为静态,将查询视为无状态,从而使工作负载的结构未被利用。 AgentIR 将融合视为沿着两个轴的每个查询决策:应用哪种融合(BM25、Dense、RRF 或代理感知 RRF),以及 ~52 ms 密集通道是否值得运行。第二个轴是置信度触发的级联路由器,它仅根据 BM25 top-k 余量进行决策,并在无需重新训练的情况下跨工作负载进行重新调整。在 LongMemEval (n=500) 上,密集通道确实添加了信息,级联以奇偶校验 LLM 判断的准确性跳过 63% 的查询(在两个判断下快 2.67 倍,配对引导 p>=0.88);每个 qtype 阈值在 5 倍交叉验证下将其扩展至 5.76 倍。在 LoCoMo (n=1,982) 上,BM25 本身已经是最强的单一系统,相同的触发器自动调整到 100% 跳跃率(快 132 倍,+0.089 Hit@5)。共享 8 核虚拟机的容量从约 154 个并发代理增加到约 1,400 个并发代理 (9 倍)。在级联之下,时间分区索引的工作时间复杂度为 O(log 1/epsilon),与语料库大小无关:1234 倍的语料库增长仅花费 3.6 倍的延迟,在 5M 记录上以低于 100 us p50 的速度以 1769 倍的速度结束。在 9 个 BEIR 数据集(高达 880 万个文档)上,与 Lucene 的质量相同,该基质的运行速度比 Pyserini 8T 快 10 倍,比 PISA-1T BlockMax-WAND 快 11 倍; A100 达到 Pyserini 8T 的 1.8-39 倍;分块索引构建在 MS MARCO 上维持 56.8K 文档/秒。记录并修复了三个微妙的 BM25/GPU 正确性缺陷,这些缺陷会默默地将 nDCG@10 降低 6-8 倍;修复后 CPU 和 GPU 在适合单个 A100 的所有八个数据集上的一致性在 0.0002 nDCG@10 范围内。