论文

TSUBASA:通过进化记忆和上下文自学习来提高长期个性化 蒸馏

TSUBASA: Improving Long-Horizon Personalization via Evolving Memory and Self-Learning with Context Distillation

摘要

个性化 大语言模型 (PLLM) 因其根据个人需求和偏好调整输出的能力而受到广泛关注。然而,他们仍然难以应对长期任务,例如跟踪用户的大量对话或活动历史记录。现有的记忆机制通常无法捕获不断变化的行为,而 RAG 范式则陷入质量效率权衡的困境。同时,由于标记数据的稀缺,参数自适应受到训练推理差距的瓶颈。为了增强 PLLM 的长期能力,我们引入了 TSUBASA,这是一种双管齐下的方法,旨在通过动态内存演化来改善内存写入,并通过自学习来改善内存读取,并以上下文 蒸馏 为目标,以内化用户体验。使用 Qwen-3 模型系列(4B 至 32B)对长视野基准进行的广泛评估验证了 TSUBASA 的有效性,超越了主要依赖于内存写入的竞争性内存增强系统,例如 Mem0 和 Memory-R1。我们的分析进一步证实,TSUBASA 打破了质量效率障碍,实现了帕累托改进,以减少的 词元预算 提供强大、高保真的个性化。