论文

强化学习中的多模态奖励黑客

Multimodal Reward Hacking in Reinforcement Learning

模型评测模型训练强化学习鲁棒性、公平性与可信度评测RLVR

摘要

强化学习(RL)日益被用于对齐多模态大语言模型(MLLM),但更高奖励并不总意味着更好的任务表现——当视觉证据由纯文本或弱落地的奖励评估时,该风险被放大。我们在安全VQA、图表VQA与压力测试设定下研究MLLM RL中的奖励黑客:变化奖励设计、数据歧义、模型规模(2B–32B)与RL算法(GRPO、RLOO、DAPO)。我们提出新近奖励失败率(NRFR):度量代理奖励较SFT基线改善的样本中的失败。仅有结果奖励导致严重黑客——奖励黑客率(RHR)达48.1%;NRFR超过RHR表明RL在制造新失败而非仅仅继承。扩展降低但不能消除黑客:即便32B模型在仅有结果奖励下仍保留54.9%的更差率,而答案感知奖励在每个规模上都改善oracle趋势。鲁棒性也依赖算法与规模:GRPO始终最抗性,RLOO持续脆弱,DAPO从2B到8B大幅改善。视觉证据奖励仅在验证可靠时有效:关键词检查增加黑客,VLM即裁判的语义验证降低黑客。总体而言,多模态奖励黑客是优化不完美奖励的系统性结果——稳健对齐需要经得起优化压力的奖励与验证器。

强化学习中的多模态奖励黑客:论文配图
图 1:多模态奖励黑客概述。当自动代理奖励 r⁡(x,y)r(x,y) 偏离预期的预言机目标 o⁡(x,y)o(x,y) 时,强化学习可以增加奖励分数,同时降低忠实的多模态推理。中心示例显示了一个 Chart VQA 案例,其中 RL 策略通过给出正确答案获得高奖励,但伪造了视觉证据,暴露了奖励与预言机的不匹配。我们在受控多模态 RL 沙箱中研究这种故障模式,涵盖任务类型、奖励设计、RL 算法和模型规模,并诊断三种黑客类别:决策黑客、证据黑客和奖励形式黑客。 RHR、ROG 和 NRFR 等指标量化了不完美的奖励如何在优化压力下诱导捷径学习。