论文

Pref-CTRL:使用表示编辑的首选项驱动的 LLM 对齐

Pref-CTRL: Preference Driven LLM Alignment using Representation Editing

模型训练偏好优化

摘要

测试时对齐方法通过在推理时对其内部表示进行轻量级干预来控制 大语言模型 (LLM) 的输出,为 微调 提供了一种有前景的替代方案。最近,一种突出且有效的方法 RE-Control(Kong 等人,2024)提出利用在 LLM 的隐藏状态上训练的外部价值函数来通过基于梯度的编辑来指导生成。虽然有效,但这种方法忽略了对齐任务的一个关键特征,即它们通常被制定为从候选响应之间的人类偏好中学习。为了解决这个问题,在本文中,我们提出了一种新颖的基于偏好的训练框架,Pref-CTRL,它使用多目标值函数来更好地反映偏好数据的结构。我们的方法在两个基准数据集上的表现优于 RE-Control,并且在域外数据集上表现出更好的泛化能力。我们的源代码位于 https://github.com/UTS-nlPUG/pref-ctrl。