论文
缓解大语言模型对齐税的偏好数据选择
Preference Data Selection for Mitigating the Alignment Tax in Large Language Models
摘要
将大语言模型对齐到人类偏好对现实世界部署至关重要,但常常产生对齐税,导致预训练通用能力的灾难性遗忘。以往工作主要将此问题框定为优化或架构挑战,而驱动这种退化的偏好数据内在特性仍在很大程度上未被探索。本文提出BALIGN,一种平衡的数据选择策略,在优化对齐效果的同时显式缓解灾难性遗忘。通过对偏好优化梯度的理论和实证分析,我们识别出三个决定参数漂移的关键数据中心特征:参考模型的对数概率边际、选中与拒绝回应之间的token长度差、以及与通用能力语料的TF-IDF相似度。通过将这些正交特征聚合为统一的复合风险分数,BALIGN系统性地过滤掉会破坏模型内在参数或只提供极少对齐效用的高风险偏好样本。在标准人类偏好数据集上的大量实验表明,BALIGN在不损害对齐收益的前提下强力保留基础能力,以极小的计算开销持续达到最优Pareto前沿。