论文
DEFT:用于人类对齐的分布引导高效 微调
DEFT: Distribution-guided Efficient Fine-Tuning for Human Alignment
摘要
基于人类反馈的强化学习 (RLHF) 使用近端策略优化 (PPO) 等算法,使 大语言模型 (LLM) 与人类价值观保持一致,但成本高昂且不稳定。已经提出替代方案来取代 PPO 或集成监督 微调 (SFT) 和对比学习以实现直接 微调 和值对齐。然而,这些方法仍然需要大量数据来学习偏好,并且可能削弱 LLM 的泛化能力。为了进一步提高对齐效率和性能,同时减轻泛化能力的损失,本文引入了分布式引导高效微调(DEFT),这是一种结合数据过滤和分布指导的高效对齐框架,通过根据语言模型的输出分布和偏好数据的差异分布计算差异分布奖励。使用差异分布奖励从原始数据中过滤出一个小而高质量的子集,然后将其合并到现有的对齐方法中以指导模型的输出分布。实验结果表明,DEFT增强的方法在对齐能力和泛化能力方面都优于原始方法,并且训练时间显着减少。