论文

MemFold:通过策略优化学习紧凑软内存以实现长上下文个性化

MemFold: Learning Compact Soft Memory for Long-Context Personalization via On-Policy Optimization

摘要

长期为同一用户提供服务的助手必须根据该用户所透露的内容来回答:哪些偏好仍然有效,哪些偏好已修改,以及现在适用哪些限制。保留该信息与根据信息采取行动不同,两者通常会被优化,就好像它们是一样的。将信息保留为文本会使读者的输入随着保留的历史记录而增长,同时将其压缩为固定数量的潜在向量限制了界面,但通常经过训练来重建文本或模仿参考答案,这两者都是根据读者从未产生的序列进行评分的。我们rollout了 MemFold,它通过其支持的行为来优化固定预算软内存。查询条件文本记忆被压缩成 K 个连续向量,形成读者的记忆接口,然后读者在两个互补信号下接受自己的滚动训练:任务结果的组相对奖励,以及置信门控的策略蒸馏,其中冻结的文本记忆教师对学生在文本记忆下的采样标记重新评分。永远不会对教师进行采样,因此监督停留在学生的当前分布上,并且不添加自回归解码;推断它被完全删除。在三个 Qwen 主干中,MemFold 达到了我们在 PersonaMem-32K 和 PersonaMem-128K 上测量的最高准确度,其裕度随着历史长度的增加而扩大,并且无需目标域训练即可转移到 PrefEval 和 LongMemEval。消融将大部分任务增益归因于奖励项,将较小的额外增益归因于教师信号,而记忆干预表明读者依赖于其软记忆的特定于实例的内容。