论文

在单个 GPU 上进行对齐和偏好学习的凸优化

Convex Optimization for Alignment and Preference Learning on a Single GPU

模型训练偏好优化

摘要

微调 大语言模型 (LLM) 与人类偏好保持一致推动了 Gemini 和 ChatGPT 等系统的成功。然而,诸如人类反馈强化学习(RLHF)之类的方法在计算上仍然昂贵且复杂。直接偏好优化 (DPO) 提供了一种更简单的替代方案,但存在一些局限性,例如排名精度不一致、对 GPU 资源的高度依赖以及昂贵的超参数调整。我们提出了凸优化对齐和偏好学习算法(COALA):一种具有强大理论保证的新颖的轻量级策略。通过利用神经网络的凸优化重构,COALA 消除了对参考模型的需求,并显着减少了训练时间和 VRAM 消耗,从而能够在单个 GPU 上进行高效训练。四个数据集(包括 26621 个样本的综合教育反馈数据集)和六个模型(包括 Llama-3.1-8B)的实验证明了 COALA 的竞争性能和效率,同时仅利用了 DPO 总 TFLOP 的约 17.6%。与 DPO 和 ORPO 等传统方法相比,COALA 表现出稳定、单调递增的奖励,并在更短的时间内达到峰值利润。据我们所知,这是凸优化首次有效地应用于 LLM 的偏好 微调。