论文
学习用户感知回忆:长期会话记忆中的个性化检索
Learning User-Aware Recall: Personalized Retrieval in Long-Term Conversational Memory
摘要
长期对话代理应该记住过去的交互,但只有当为正确的用户回忆起正确的证据时,记忆才有用。现有的记忆增强 LLM 代理在构建紧凑的记忆库方面取得了进展,但检索仍然经常由以查询为中心的相似性或固定的排名规则驱动,从而导致用户条件相关性尚未得到充分探索。为了解决这一差距,我们提出了配置文件引导的个性化检索优化(PPRO),这是一个以检索为中心的框架,使内存检索既具有用户意识又可优化。 PPRO 从对话历史中构建情景和语义记忆库,并从累积的记忆中得出用户档案。该配置文件充当内存排名中的明确个性化先验,允许检索考虑稳定的用户属性、偏好和关系。 PPRO 通过组相对策略优化进一步训练查询重写器,使用证据检索质量和下游答案质量作为反馈,同时保持记忆库和答案模型固定。 LoCoMo 和 LongMemEval-S 上的实验表明,与 无需训练 内存系统和基于训练的基线相比,获得了一致的增益。消融研究进一步表明,配置文件引导的排名和面向检索的重写对性能都有很大贡献,强调检索优化是个性化长期记忆使用的关键因素。