论文

HiPO:面向LLM自适应推理的分层偏好优化

HiPO: Hierarchical Preference Optimization for Adaptive Reasoning in LLMs

模型训练偏好优化

摘要

直接偏好优化(DPO)是将大语言模型与人类偏好对齐的有效框架,但它在复杂推理任务上表现吃力。DPO以整体为单位优化生成偏好回应相对于非偏好回应的似然,缺乏为推理任务中典型的多步骤解法的各个子部分提供反馈的粒度。现有方法或在稳定偏好学习(如KTO、RSO等DPO变体)方面出色,或在结构化推理(如ReMA的多智能体RL框架、Tree of Thoughts)方面出色,但未能融合这两种互补优势。我们提出HiPO(Hierarchical Preference Optimization,分层偏好优化),它是DPO的扩展,将回应拆分为多个推理段(问题澄清与背景、推理步骤和答案),并将损失计算为各段DPO损失的加权和。我们的方法在保持DPO计算效率与训练稳定性的同时,实现了针对各段的训练。我们在Math Stack Exchange偏好数据集上使用HiPO和DPO微调多个7B LLM,结果表明用HiPO训练的模型在多种常见数学基准上优于其他模型,并且按GPT-4.1的评测,在条理性、逻辑流畅性与一致性方面表现更佳。

HiPO:面向LLM自适应推理的分层偏好优化:论文配图
图1:HiPO数据集构建:GPT-4.1为每个偏好对增补三个结构化片段,用于LLM的自适应推理分层偏好优化。