论文

通过基于激活的标签传播实现 LLM 的低资源偏好适应

Low-Resource Preference Adaptation of LLMs via Activation-Based Label Propagation

模型训练合成数据

摘要

使 大语言模型 适应用户特定的偏好通常受到人工注释成本的限制,这使得偏好优化在资源匮乏的环境中变得不切实际,因为 LLM 本身无法可靠地标记偏好,例如,由于文化、主观或个性化背景。在本文中,我们研究了语言模型如何在其中间表示中编码偏好信息,发现即使在预训练的模型中,选择和拒绝的响应的激活也形成跨层的不同集群。引人注目的是,这种结构通过规范数据集的对齐得到了加强,但当目标偏好与模型对齐的偏好不同时,这种结构就被删除了,这表明对齐的 LLM 对于非主流人群的判断力很差。利用这种结构,我们建议在一些标记偏好对($\leq$500)上训练轻量级线性探针,并使用它来注释大型未标记数据集(50K+)以进行下游偏好优化。我们在不同的数据集、偏好优化方法和模型规模上系统地评估了这种方法,发现在相同的注释预算下,我们的方法始终优于直接训练,并且在大多数设置中与使用 50-100 倍标记数据训练的基线相比仍然具有竞争力。代码可在 https://github.com/alessioGalatolo/activ-pref-probe 获取。