论文

重建正确的情节:评估长上下文之外的交错对话记忆

Reconstructing the Right Episode: Evaluating Interleaved Conversational Memory Beyond Long Context

模型评测基准与评测资源

摘要

与聊天助理的对话越来越多地在一个长时间运行的线程中跨越许多主题,这对记忆系统提出了挑战。现有的长上下文和记忆基准测试通常会暴露会话或主题边界,或探究直接的个人记忆问题。这些设置低估了更困难的辅助记忆机制:一个扁平的混合主题线程,系统必须推断哪个较早的情节使稍后的任务决策有效。我们引入了 SCALE-QA,这是一种基于约束的任务 QA 基准,用于针对事件完整性失败的平面未分段线程。该数据集包含 10 个领域的 3,000 个审核问题,使用确定性四向多项选择评分,并包含确定性运行时构建器;实验使用 128k 范围内的所有 3,000 个问题以及 1M 范围内的分层 400 个问题诊断。 SCALE-QA 问题是普通的面向任务的请求,其正确答案取决于对话中之前引入的因果相关证据。我们还提出了时间语义交错记忆重建(TSIM),它将转向流分割成连贯的情节,并通过具有确定性情节级别摘要和集群路由视图的分层多视图内存堆栈对它们进行索引。实验表明,SCALE-QA 挑战了强大的 RAG 基线和长上下文 LLM;在三个开源和专有的 LLM 后端中,TSIM 在每个后端设置中都实现了最高的准确度,比最强的相应基线获得了 5.6-17.6 的准确度点。