论文

连接感知和推理:多模式中 RLVR 的词元重新加权 LLM

Bridging Perception and Reasoning: Token Reweighting for RLVR in Multimodal LLMs

模型训练强化学习

摘要

将具有可验证奖励的强化学习 (RLVR) 扩展到多模态 大语言模型 (MLLM) 面临着一个根本性的挑战:它们的响应本质上交织着与感知相关的标记,这些标记奠定了视觉内容的基础,与推理相关的标记构成了推理链。这些标记类型实例化了不同但相互依赖的能力——视觉基础和符号推理——使得孤立的优化不够。通过 词元级 实证分析,我们证明优化仅感知或仅推理的词元始终表现不佳,强调了它们固有的耦合。为了解决这个问题,我们提出了一种即插即用的词元重新加权(ToR)策略,该策略通过识别两种类型的关键词元并在 RLVR 训练期间动态重新加权来显式模拟这种相互依赖性。在现有方法(例如 GRPO 和 DAPO)之上应用,ToR 在多个多模态推理基准中提供一致的性能增益,通过准确的视觉基础和连贯推理实现最先进的性能。