论文

S3Mem:用于长视野交互式问答的结构化时空场景事件记忆

S3Mem: Structured Spatiotemporal Scene-Event Memory for Long-Horizon Interactive Question Answering

摘要

长视野记忆问答通常需要来自异质历史的稀疏证据,包括事件、对象状态、视觉观察、时间关系和因果步骤。现有的内存接口扩展了读者上下文、检索语义相关的块或公开图邻域,但它们并未明确设计为为固定读者选择紧凑的证据。我们提出了结构化时空场景事件记忆(S3Mem),这是一种查询时记忆接口,它将文本、视觉和代理使用历史写入结构化场景事件单元,并将紧凑的证据包路由给读者。其路由器对候选单元、查询锚点和锚点支持链接进行评分,从而实现单跳选择和短多跳证据链,无需阅读器 微调 或测试时训练。在 LoCoMo、EMemBench Visual Games 和 AMA-Bench 中,S3Mem 提供了强大的分数-词元权衡,在局部事件、状态、时间、因果或来源证据方面获得了最明显的收益。在 LoCoMo 上,S3Mem 达到 \(0.48\) F1 和 \(0.40\) BLEU,每个问题有 (1{,}073) 个证据标记,大约比 LoCoMo 参考少 \(15.8\times\)。在 EMemBench Visual Games 上,它仅用 \(189\) 个 token 就获得了最好的 F1 和第二好的准确率。在 AMA-Bench 上,它不是得分最高的方法,但在使用最少的读者可见证据 token 的情况下仍然保持竞争力。