论文
PERSIST:跨会话全双工对话的谁、什么、何时记忆
PERSIST: Who-What-When Memory Across Sessions for Full-Duplex Spoken Dialogue
摘要
现代语音助手可能由多个用户共享,并且应该能够回答有关早期对话的问题,例如“我最初计划什么时候离开?”或者根据过去的交互来调整他们的行为以适应各个用户。这需要的不仅仅是检索主题相似的段落:助手必须识别当前的说话者,恢复相关的过去状态,并将其与后来的修订区分开来。我们提出了 PERSIST,这是一个持久的记忆系统,用于多会话、多说话者口语对话,它明确地模拟了谁、什么和何时。 PERSIST 将跨会话历史记录构建为可读的事件记录,并通过结合了语义内容、声学说话者身份和时间状态的 3W 联合评分机制来检索它们。对于实时全双工交互,PERSIST 进一步重用对话 骨干模型 的中间表示,避免查询音频重新编码并将检索延迟从 578.42 ms 减少到 7.03 ms。我们还引入了 SpokenTrace,这是一种诊断基准,可分解记忆任务和说话人查询类型的评估,暴露 召回率、说话人归因和时间状态跟踪中的故障。在 SpokenTrace 上,PERSIST 实现了 85.08% 的端到端任务准确率,并将全支持 EM@3 从 BGE-large 的 49.01% 提高到 82.10%。
