论文

PERSIST:跨会话全双工对话的谁、什么、何时记忆

PERSIST: Who-What-When Memory Across Sessions for Full-Duplex Spoken Dialogue

上下文与知识记忆Agent记忆

摘要

现代语音助手可能由多个用户共享,并且应该能够回答有关早期对话的问题,例如“我最初计划什么时候离开?”或者根据过去的交互来调整他们的行为以适应各个用户。这需要的不仅仅是检索主题相似的段落:助手必须识别当前的说话者,恢复相关的过去状态,并将其与后来的修订区分开来。我们提出了 PERSIST,这是一个持久的记忆系统,用于多会话、多说话者口语对话,它明确地模拟了谁、什么和何时。 PERSIST 将跨会话历史记录构建为可读的事件记录,并通过结合了语义内容、声学说话者身份和时间状态的 3W 联合评分机制来检索它们。对于实时全双工交互,PERSIST 进一步重用对话 骨干模型 的中间表示,避免查询音频重新编码并将检索延迟从 578.42 ms 减少到 7.03 ms。我们还引入了 SpokenTrace,这是一种诊断基准,可分解记忆任务和说话人查询类型的评估,暴露 召回率、说话人归因和时间状态跟踪中的故障。在 SpokenTrace 上,PERSIST 实现了 85.08% 的端到端任务准确率,并将全支持 EM@3 从 BGE-large 的 49.01% 提高到 82.10%。

PERSIST:跨会话全双工对话的谁、什么、何时记忆:论文原图
图 2:PERSIST 系统概览。 记忆编写器不断地将语音跨度转换为可读的记忆记录,这些记录在活动上下文之外和跨会话持续存在。当对话模型发出特殊的 token <retrieve> 时,检索器对查询进行编码,并使用语义、说话者和时间信息根据存储的键对其进行评分。然后,顶级 $k$ 记录将合并到模型的短期活动上下文中以生成响应。