论文

MoF:黑盒 LLM 个性化的偏好分面混合

MoF: Preference-Aware Mixture Modeling for Black-Box LLM Personalization

模型训练偏好优化

摘要

专有的大语言模型 (LLM) 在广泛的任务中展示了卓越的功能,但将其输出与不同的用户偏好保持一致仍然具有挑战性。现有的黑盒LLM个性化方法通常依赖于用户特定的评分头,导致个性化参数的数量随着用户数量线性增长,并且需要针对看不见的用户进行额外的适应。为了解决这些限制,我们提出了 Mixture-of-Facets (MoF),这是一种用于黑盒 LLM 的可扩展个性化框架,它将用户偏好建模为共享潜在偏好方面的组合,而不是专用于用户特定的参数。 MoF 通过共享分面头上的历史条件路由来执行个性化,从而为训练期间看不见的用户提供个性化,无需额外的参数更新。在不同的个性化任务中,MoF 提供了更强大的个性化性能,同时保持比以前的方法更具可扩展性和参数高效的设计。附加分析表明对未见过的用户具有很强的泛化性。

MoF:黑盒 LLM 个性化的偏好分面混合:论文原图
图 1:训练和推理管道概述。 (a) 训练阶段:使用从多个用户收集的数据联合训练共享基础模型和评分头。 (b) 拟合阶段:基本模型被冻结,而仅更新未见过的用户的评分头。 (c) 推理阶段:重新排序器选择有用的历史项,黑盒 LLM 生成候选响应,适配器对候选进行评分以产生最终响应。