论文
InSPO:为LLM偏好优化解锁内在自我反思
InSPO: Unlocking Intrinsic Self-Reflection for LLM Preference Optimization
摘要
直接偏好优化(DPO)及其变体因简单和离线稳定而广泛用于LLM对齐,但作者指出两个根本限制。首先,最优策略依赖标量化函数、参考策略等任意建模选择,行为可能反映参数化设置而非真实偏好。其次,把回答生成孤立处理,未充分利用成对偏好数据的比较信息,使模型的内在自我反思能力没有被激活。本文提出内在自反思偏好优化InSPO,推导同时以上下文和备选回答为条件的全局最优策略。作者证明该形式优于DPO/RLHF,并对标量化和参考策略选择保持不变性。InSPO可作为即插即用增强,无需修改架构或增加推理开销。实验显示胜率和控制长度后的指标持续改善,支持通过自反思得到更稳健、更符合人类偏好的LLM。
