论文

LLM对齐真的需要多样性吗?RLVR方法适配道德推理的实证研究

Does LLM Alignment Really Need Diversity? An Empirical Study of Adapting RLVR Methods for Moral Reasoning

模型评测模型行为与机制分析

摘要

可验证奖励强化学习(RLVR)在逻辑推理任务上取得显著成功,但大语言模型(LLM)对齐是否需要根本不同的方法仍不清楚。鉴于道德推理对多个有效响应的明显容忍,一个自然假设是:对齐任务天然需要寻求多样性的分布匹配算法,而非奖励最大化的策略类方法。我们在MoReBench上开展首个系统性实证研究比较两种范式。为支持稳定RLVR训练,我们训练Qwen3-1.7B裁判模型构建量规接地的奖励管线。与假设相反,我们发现分布匹配方法在对齐任务上并未如预期显著优于奖励最大化方法。通过把高奖励响应语义映射到语义空间可视化,我们证明道德推理的高奖励分布比数学推理更集中——后者多种解题策略都能得到相似高奖励。这一反直觉发现解释了为何寻模优化在对齐任务上同样有效甚至更有效。结果表明对齐任务并不天然需要保多样性算法,标准奖励最大化RLVR方法无需显式多样性机制即可有效迁移到道德推理。

LLM对齐真的需要多样性吗?RLVR方法适配道德推理的实证研究:论文配图
图1:MATH-500(蓝)与MoReBench-Public(红)六个案例中高奖励回答在语义空间的分布可视化。