论文
强化学习中的多模态奖励黑客
Multimodal Reward Hacking in Reinforcement Learning
摘要
强化学习(RL)日益被用于对齐多模态大语言模型(MLLM),但更高奖励并不总意味着更好的任务表现——当视觉证据由纯文本或弱落地的奖励评估时,该风险被放大。我们在安全VQA、图表VQA与压力测试设定下研究MLLM RL中的奖励黑客:变化奖励设计、数据歧义、模型规模(2B–32B)与RL算法(GRPO、RLOO、DAPO)。我们提出新近奖励失败率(NRFR):度量代理奖励较SFT基线改善的样本中的失败。仅有结果奖励导致严重黑客——奖励黑客率(RHR)达48.1%;NRFR超过RHR表明RL在制造新失败而非仅仅继承。扩展降低但不能消除黑客:即便32B模型在仅有结果奖励下仍保留54.9%的更差率,而答案感知奖励在每个规模上都改善oracle趋势。鲁棒性也依赖算法与规模:GRPO始终最抗性,RLOO持续脆弱,DAPO从2B到8B大幅改善。视觉证据奖励仅在验证可靠时有效:关键词检查增加黑客,VLM即裁判的语义验证降低黑客。总体而言,多模态奖励黑客是优化不完美奖励的系统性结果——稳健对齐需要经得起优化压力的奖励与验证器。
