论文
记忆深度与重建上下文宽度的受控检索评测
Memory Depth and Reconstructed Context Width: A Controlled Evaluation of Hierarchical Retrieval
摘要
长期会话式记忆正在成为现代 LLM 系统的一个组成部分。所提出的架构按主题和事件对记录进行分组,构建层次结构和图表,并通过因果关系和时间关系连接事实。我们通过实验研究两个记忆参数 之间的交互:结构深度和提供给答案模型的上下文宽度。使用 EverMemBench,我们评估深度 D1-D4、1,024/2,048/4,096 token 的核心预算,以及直至完整存档的其他生产和 Oracle 条件。将宽度从 1K 增加到 4K 可将准确度提高 10.11-17.98 个百分点,而增加深度则不会带来单调增益。超过 8-16K,生产性能达到稳定水平,而每个正确答案的 token 继续增加; Oracle 保持 68-71K token 完整档案的质量。这些结果激发了对大型、连贯上下文块的进一步研究,而不是逐渐深入的记忆结构。