论文

SpeakerMem-R1:以说话人为中心的双轨内存,用于多方对话

SpeakerMem-R1: Speaker-Centered Dual-Track Memory for Multi-Party Dialogue

摘要

多方环境中的长期对话记忆需要的不仅仅是从长期对话中检索相关内容:它必须区分谁说了什么、每个陈述涉及谁、个人如何看待彼此、群体共享哪些信息以及状态如何随时间变化。最近对多方对话基准的研究表明,现有的通用 LLM 记忆系统往往会失去人和群体的关系,或者难以整合分布在成员、群体和时间之间的线索。这些问题共同揭示了两个核心瓶颈:多方对话中的信息归因和关系理解,以及从交错的历史中重建国家。为了解决这两个问题,我们提出$\textbf{SpeakerMem-R1}$:它的双轨内存存储说话者标记的逐字消息和组织成个人级和组级视图的派生状态,然后在查询时按实体、事件和时间组合来自两个轨道的证据。为了减少结构化内存构建期间的归因和更新错误,同时实现本地部署,我们使用SpeakerLevenshtein 和说话人调节的 GRPO 来训练 Writer-R1。在 GroupMemBench、SocialMemBench 和 EverMemBench 上,SpeakerMem-R1 的二进制准确率分别为 47.9%、69.2% 和 61.9%。在 EverMind-AI 公开报道的 EverMemBench 排行榜上,我们取得了 62.33% 的成绩,这是最新最先进框架中报告最好的结果。它还在所有 1,986 个 LoCoMo 问题上达到了 70.85%,我们将其用作两人长期对话边界测试。在对 305 个问题的受控评估中,强化学习将 SFT Writer 的平均准确率从 57.38% 提高到 68.20%。我们报告了二进制准确性和 token-F1,并且消融表明逐字记录和结构化轨道以及个人级别和组级别的视图在标准化评估界面下是互补的。