论文
长期对话的记忆镜头
Memory Shot for Long-Term Dialogue
摘要
大语言模型(LLM)在一般对话、指令跟随和复杂推理方面表现出了强大的能力。然而,在长期对话环境中,他们常常很难找到和利用与当前查询最相关的历史信息。现有方法通过压缩和重组用户交互历史来构建结构化的以文本为中心的存储单元来解决这个问题。然而,这些系统通常依赖于暴力提取关键证据来关联对话会话中的事件,从而导致大量的计算开销并削弱结构线索,例如说话者转换、转弯边界和局部上下文关系。为了避免脆弱的基于文本的记忆表示,我们提出了 MemShot,它利用对话结构进行长期对话建模,并依靠模型的内部视觉推理能力来关联关键情节。具体来说,MemShot 将本地连续对话跨度渲染为结构化视觉记忆单元,保留元信息和按时间顺序排列的对话轮流,同时避免重量级文本记忆构建。实验结果表明,MemShot 在 LoCoMo 和 LongMemEval 上均实现了稳定且具有竞争力的性能,同时大幅缩短了内存构建流程,并实现了 70$\times$ 的加速。进一步的分析表明,MemShot 通过将记忆处理导向结构化的本地对话线索而不是平面文本流中的表面词汇匹配来增强历史证据的本地化和利用。所有代码均发布在 https://github.com/NEUIR/MemShot 上。