论文
数据缺乏下LLM的协同个性化偏好对齐
Collaborative Personalized Preference Alignment for LLMs under Data Deficiency
摘要
现实世界的用户通常对LLM响应的多个目标表现出高度异构的偏好。轻量级对准器可以根据个人喜好定制这些响应,但缺乏用户特定的反馈使得个性化训练变得困难。学习跨用户共享的初始化可以支持小样本适应。然而,异构偏好和竞争目标会导致用户之间和每个用户内部的梯度冲突,从而阻碍有效的初始化学习。这就提出了一个核心问题:我们如何协作学习支持少数镜头适应不同用户偏好的对齐器初始化?为了回答这个问题,我们提出 Approximate Pareto Optimality (APO)。我们首先对更新兼容的用户进行分组,以便他们的信息可以在干扰较少的情况下进行组合。在每个组中,我们将梯度下降与受控上升结合起来,以协调相互竞争的目标,并朝着帕累托前沿上特定偏好的点移动。这会产生接近组中用户的最优值的初始化。然后,我们使用少量本地适应的更新迭代地完善它,使其更有效地实现个性化。此外,我们为单步协作更新建立了条件次优边界,并描述了初始化误差如何影响后续的随机适应。 Fed-ChatbotPA 和 UltraFeedback 上的实验表明,仅使用 20 个本地示例,现有方法就得到了一致的改进。
