论文
内在互信息作为偏好优化的调节器
Intrinsic Mutual Information as a Modulator for Preference Optimization
摘要
离线偏好优化方法,例如直接偏好优化 (DPO),在使 大语言模型 (LLM) 与人类价值观保持一致方面具有显着优势。然而,使用这些方法实现最佳性能通常需要额外的超参数调整,从而导致大量的时间开销。尽管先前的工作提出了一系列改进,但这些方法的有效性仍然有限,并且尚未完全消除对超参数调整的依赖。在这项工作中,我们提出了 RMiPO,一个轻量级且高效的离线偏好优化框架。 RMiPO 利用内在的响应级互信息通过超参数调制进行偏好优化,以可忽略的额外计算成本动态解耦偏好贡献。大量的实验结果表明,RMiPO 始终比现有方法实现卓越的性能,同时将训练开销减少 15% 以上。我们的代码可在 https://github.com/liavonpenn/rmipo 获取。