论文
Spectral Souping:在线偏好调整的统一框架
Spectral Souping: A Unified Framework for Online Preference Alignment
摘要
来自人类反馈的强化学习 (RLHF) 有效地将 大语言模型 (LLM) 与人类总体偏好结合起来,但往往无法满足个人用户多样化且相互冲突的需求。为了解决这个问题,我们引入了 Spectral Souping,这是一个用于高效在线偏好调整的统一框架。我们的贡献是在 LLM 中发现了通用光谱表示,它被证明非常适合模型合并。这种理论洞察力实现了一个两阶段的方法:我们首先学习线下专门政策的基础,每个政策都专注于一个独特的、细粒度的偏好维度。然后,在线适应算法通过合并其输出或参数,在推理时有效地“汤”这些策略,从而实现快速模型适应,而无需进行昂贵的在线再训练。量身定制的偏好奖励。在线偏好对齐基准的实验表明,我们的方法比现有最先进的方法实现了显着的性能改进,提供了一种可扩展且计算高效的解决方案,可以动态地使 LLM 适应个人用户偏好。