论文
作为频谱更新重组的偏好调整
Preference Tuning as Spectral Update Reorganization
摘要
基于偏好的 后训练 通常通过端点行为来理解,但产生此行为的学习更新在很大程度上仍然是不透明的。我们通过诱导参数更新的谱结构来研究 RLHF 和相关偏好优化。通过分解有效的 LoRA 更新并将其频谱组件作为插件模块重新加载,我们将偏好引起的更新转变为可以隔离、重组和直接干预的对象。跨模型系列、优化算法和监督机制,这些更新一致地发展了光谱头尾组织。紧凑的头部出现较早,并带有主要的端点偏移,而异质的残留尾部仍然存在。这种分割是功能性的,而不仅仅是描述性的。插件干预表明,头部解释了与基本模型的明显行为偏离,而尾部则在孤立状态下很弱。交叉运行重组进一步表明,混合适配器遵循头部的源,表明头部带有运行级解算器偏差。这种端点优势并不意味着学习充分。仅头学习不是空洞的,但无法恢复完整的解决方案,特别是在分布外行为上。仅尾部学习几乎没有产生明显的增益,但没有尾部就无法恢复完整的解决方案。这些发现将偏好 后训练 重新定义为结构化更新重组,而不是整体行为校正,并表明对齐增益和覆盖损失与学习更新本身的组织方式相关。