论文

假设引导的自蒸馏:实现持续个性化

Hypotheses-Guided Self Distillation for Continual Personalization

模型训练持续学习

摘要

随着人们在日常生活中与LLM助理的互动越来越多,不断适应个人偏好对于有效的长期互动至关重要。然而,用户偏好很少被完整表述,而是通过异构、潜在和噪声信号出现,现有方法依赖于原始交互历史或昂贵的基于奖励的优化来管理个性化。我们引入了 HypReflect,这是一个用于持续个性化的可靠、可扩展的框架,它从不同的用户信号中推断出明确的、具有不确定性的偏好假设,随着新证据的积累反思性地完善它们,并通过假设引导的自我蒸馏合并生成的用户模型。跨三种个性化设置的实验:在线个性化、多会话交互和隐式行为信号,表明 HypReflect 优于一系列基线,包括原始历史和增量更新方法。我们进一步展示了对看不见的用户和跨域设置的强大泛化能力,以及跨上下文预算的稳定性、可重用的假设和更有针对性的个性化。这些结果表明,通过明确的、可修改的用户偏好假设,朝着可靠且可扩展的持续个性化迈​​出了一步。

假设引导的自蒸馏:实现持续个性化:论文配图
图1 个人化环境中的首选假设来自明确的反馈、隐含的行为信号和用户概况信息,以及信心加权。它们保持对用户的明确和可反感的信念,并指导模型产生个性化反应。