论文
适用于 大语言模型 的兼容性感知动态 微调
Compatibility-Aware Dynamic Fine-Tuning for Large Language Models
摘要
有监督的 微调 (SFT) 是对齐 大语言模型 (LLM) 的主要范例,但它存在优化不稳定和泛化有限的问题。最近的工作将此问题归因于病态梯度缩放,并提出动态 微调 (DFT) 在 词元级 上纠正它。然而,DFT 假设所有演示都是同样合适的学习目标,大规模指令数据的强异质性违反了这一假设,其中演示策略不匹配会导致样本级别的高方差更新。我们引入了兼容性感知动态 微调 (CADFT),它是 DFT 的原则性扩展,可控制样本级优化方差。 CADFT 从模型可能性中导出动态的、依赖于策略的兼容性信号来调节监督更新,从而抑制不兼容演示中的高方差梯度。我们进一步提出了一种延迟的、低频兼容性引导的重写策略,将持续不兼容的演示转变为可学习的目标。我们证明 CADFT 可以解释为方差控制估计器,它将 DFT 中的 词元级 稳定性推广到样本水平。大量的实验证明了稳定性、泛化性和冷启动强化学习初始化的改进,同时保持完全监督和独立于显式奖励模型。