RLearner-LLM:通过混合直接偏好优化平衡 大语言模型 的逻辑基础和流畅性
RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization
摘要
直接偏好优化 (DPO) 是基于 PPO 的 RLHF 的有效替代方案,但在知识密集型生成方面存在不足:来自人类注释者或 LLM 法官的标准偏好信号表现出系统性的冗长偏差,奖励流畅性而不是逻辑正确性。这个盲点留下了一个逻辑对齐缺口——尽管 SFT 模型生成了流畅的文本,但 NLI 蕴涵仅达到 0.05-0.22。我们提出带有 Hybrid-DPO 的 RLearner-LLM:一种自动偏好管道,将 DeBERTa-v3 NLI 信号与验证器 LLM 分数融合在一起,消除人工注释,同时克服单信号优化的“对齐税”。通过使用三种基本架构(LLaMA-2-13B、Qwen3-8B、Gemma 4 E4B-it)对五个学术领域(生物学、医学、法律)进行评估,RLearner-LLM 的 NLI 比 SFT 提高了 6 倍,15 个单元格中的 11 个单元格获得了 NLI 增益,并且答案覆盖率得到了一致的增益。在 Gemma 4 E4B-it(4.5B 有效参数)上,Hybrid-DPO 在五个域中的四个域中提升了 NLI(+11.9% 至 +2.4x),并在所有五个域中进行更快的推理,在不损失对齐税缓解的情况下缩小到紧凑的基本模型。我们的 Qwen3-8B RLearner-LLM 在与其自己的 SFT 基线的成对比较中赢得了 95% 的胜利; GPT-4o-mini 反过来在我们的简洁输出中赢得了 95% 的胜利——除了赢得 69% 的胜利之外,同一个评委还对我们的 DPO 模型给出了详细的 SFT,这复制了前沿比较器上的冗长偏差,并激发了逻辑感知指标(NLI、ACR),而不是 LLM 作为知识密集型生成的评判。