论文
假设引导的自蒸馏:实现持续个性化
Hypotheses-Guided Self Distillation for Continual Personalization
摘要
随着人们在日常生活中与LLM助理的互动越来越多,不断适应个人偏好对于有效的长期互动至关重要。然而,用户偏好很少被完整表述,而是通过异构、潜在和噪声信号出现,现有方法依赖于原始交互历史或昂贵的基于奖励的优化来管理个性化。我们引入了 HypReflect,这是一个用于持续个性化的可靠、可扩展的框架,它从不同的用户信号中推断出明确的、具有不确定性的偏好假设,随着新证据的积累反思性地完善它们,并通过假设引导的自我蒸馏合并生成的用户模型。跨三种个性化设置的实验:在线个性化、多会话交互和隐式行为信号,表明 HypReflect 优于一系列基线,包括原始历史和增量更新方法。我们进一步展示了对看不见的用户和跨域设置的强大泛化能力,以及跨上下文预算的稳定性、可重用的假设和更有针对性的个性化。这些结果表明,通过明确的、可修改的用户偏好假设,朝着可靠且可扩展的持续个性化迈出了一步。
