论文

InSPO:为LLM偏好优化解锁内在自我反思

InSPO: Unlocking Intrinsic Self-Reflection for LLM Preference Optimization

模型训练偏好优化

摘要

直接偏好优化(DPO)及其变体因简单和离线稳定而广泛用于LLM对齐,但作者指出两个根本限制。首先,最优策略依赖标量化函数、参考策略等任意建模选择,行为可能反映参数化设置而非真实偏好。其次,把回答生成孤立处理,未充分利用成对偏好数据的比较信息,使模型的内在自我反思能力没有被激活。本文提出内在自反思偏好优化InSPO,推导同时以上下文和备选回答为条件的全局最优策略。作者证明该形式优于DPO/RLHF,并对标量化和参考策略选择保持不变性。InSPO可作为即插即用增强,无需修改架构或增加推理开销。实验显示胜率和控制长度后的指标持续改善,支持通过自反思得到更稳健、更符合人类偏好的LLM。

InSPO:为LLM偏好优化解锁内在自我反思 配图
图1:从成对偏好学习转向InSPO。标准DPO仅依据提示评估偏好与非偏好回答,学习次优策略;InSPO通过对称交叉条件化激活自反思:生成偏好回答时将非偏好回答作为上下文,反向过程亦然,以备选回答提供改进指导。绿色项表示新目标中的自反思机制。