论文

RLVR 中的多语言验证者偏差:基准、采样轨迹诊断和跨语言选择瓶颈

Multilingual Verifier Bias in RLVR: Benchmark, Rollout Diagnosis, and the Cross-Lingual Selection Bottleneck

模型评测模型训练强化学习评测方法与指标RLVR

摘要

具有可验证奖励的强化学习 (RLVR) 是训练 大语言模型 数学推理的标准方法,其中答案验证器充当语言中立的奖励函数。我们证明这种假设在多语言环境中失败:精确匹配验证器将格式和脚本变化转化为依赖于语言的假阴性奖励噪声。我们引入了一种可重用的协议来审核多语言 RLVR 奖励:验证者稳健性套件、采样轨迹诊断程序以及针对日语、英语和中文答案的语言条件奖励错误指标。在 k=8 的 MGSM采样轨迹中,精确匹配代理在 Qwen3-4B、Qwen3-8B 和 Llama-3.1-8B-Instruct 上以截然不同的速率拒绝可信正确答案;对于 Qwen3-8B,JP 上的假阴性率达到 0.642,而 EN 上的假阴性率为 0.122,CN 上的假阴性率为 0.073。纯数字探针将机制定位到最终答案接口:接口模型将奖励误差 VLB 驱动至零,而剩余精度差距保持不变。然后,我们暴露了跨语言选择瓶颈:在 MGSM250采样轨迹中,不使用可信标签的目标本地聚合规则弥补了 55-78% 的平均选择差距,并且超过 95% 的修复需要真正的跨语言支持。该瓶颈在 483 个问题的 MATH-500 集合上复制。受控训练审核表明,规则 GRPO 提高了可信准确性,同时奖励错误 VLB 保持较高水平。统一的信息是可操作的:多语言 RLVR 奖励在优化之前应按语言和答案界面进行审核。