论文

COPE:通过用户嵌入和自我评估在稀疏用户反馈下持续个性化大语言模型

COPE: Continual Personalization of LLMs under Sparse User Feedback via User Embeddings and Self-Evaluation

模型训练持续学习

摘要

虽然大型语言模型 (LLM) 在各种基准测试中取得了显着的成果,但它们与规范值的一致性往往会导致同质化的响应,无法满足不同的用户偏好。现有的免训练方法通常通过即时工程占据宝贵的上下文窗口,而基于训练的方法通常在训练后保持静态,无法支持现实环境中所需的持续优化。为了应对这些挑战,我们提出了 COPE(带有个性化嵌入和自我评估的持续优化),这是一种新颖的优化框架,专为具有稀疏用户反馈的现实世界驱动的交互设置而定制。我们的框架为每个用户分配可学习的个性化嵌入,并在单个更新步骤中协同集成偏好捕获、自我评估校准和个性化响应优化。我们方法的一个关键创新是使用自我评估来生成代理奖励,即使在无法获得明确的用户反馈的情况下也能实现持续的模型更新。实验表明,COPE 在稀疏反馈下始终优于强大的无训练和基于训练的基线,并且仍然是检索增强提示 (RAP) 的补充。进一步的分析证实了 COPE 可靠的自我评估、有意义的偏好模式、稳定的一般能力以及在偏好变化和替代评估者下的稳健性。