论文
MemoryDocDataSet:联合会话记忆和长文档推理的基准
MemoryDocDataSet: A Benchmark for Joint Conversational Memory and Long Document Reasoning
摘要
人工智能系统越来越需要结合两种要求较高的功能:导航多会话对话历史记录和在长文档中执行深度阅读理解。然而,现有的基准还没有同时评估两者。我们引入了 MemoryDocDataSet,这是一个由 50 个微观世界和 1,000 个 QA 对组成的综合基准,其中每个实例包含 3-5 个人物角色、一个跨越数月活动的时间事件图、3-5 个真实的长文档(每个文档来自 Caselaw Access Project 的 20,000-50,000 个词元)、基于这些文档的多会话对话以及跨五个推理类别的 20 个问答对。定义功能是混合源标签:要求系统首先导航对话历史记录以识别哪个文档相关的问题,然后从该文档中提取答案。混合问题占数据集的 75.1%。数据集质量通过使用 LLM 作为判断者的即时敏感性自我一致性分析来表征,产生所有 50 个微观世界的中值 Cohen $κ= 0.634$。我们评估了六种基线配置,涵盖截断上下文、长上下文 LLM、检索增强生成 (RAG) 和记忆系统。最佳基线 (RAG-Both) 总体 F1 达到 0.358,混合动力达到 0.342。尽管在纯文档问题上取得了 0.453 的成绩,但纯文档检索 (RAG-Doc) 在混合上却崩溃至 0.267,这表明了明显的联合检索差距,促使架构将会话记忆与长文档导航相统一。我们发布了数据集、生成管道和所有基线实现。