论文
连接点:长视野对话中反思记忆的基准测试
Connecting the Dots: Benchmarking Reflective Memory in Long-Horizon Dialogue
摘要
尽管长上下文建模取得了实质性进展,但现有基准仍然局限于外显回忆的事实记忆,未能测量将碎片化的多模态线索合成为高级解释所需的反射记忆。为了解决这一差距,我们引入了 RefMem-Bench,这是长视野对话中反思记忆的基准。 RefMem-Bench 包含 26K 个带注释的 QA 实例,具有八个反射记忆维度和三种任务格式,要求模型超越表面级别的检索,并从分布在交互历史中的证据推断潜在含义。为了增强反思性记忆能力,我们提出了反思性记忆归纳(REMIND),这是一种将反思性记忆视为渐进式意义建构的分层框架。 REMIND 将问题条件证据检索、显着性感知基础和抽象级监督结合起来,并使用渐进反思对齐将高级反思推理提炼为事实推理路径。实验表明,RefMem-Bench 对当前模型提出了重大挑战,而 REMIND 通过渐进的证据感知、基础和抽象,不断提高答案准确性和记忆回忆。