论文
SPLIT-RL:具有主张级优势的分阶段感知语言推理训练
SPLIT-RL: Staged Perception-Language Reasoning Training with Claim-Level Advantages
摘要
视觉语言 (VL) 推理需要一个模型从图像中提取相关且准确的信息(视觉推理,VR),并从中推断答案(语言推理,LR)。具有可验证奖励的强化学习通常通过单一思维链和最终答案奖励进行训练。这为每个 CoT token提供了相同的序列级优势,无法区分功能特定的错误。我们提出了 SPLIT-RL,这是一种分阶段的训练后方法,可以在不相交的阶段中训练 VR 和 LR。由于团队的推出每次在一项功能上有所不同,因此团队相对优势将其隔离开来,并且每个阶段都使用特定于阶段的奖励进行优化。我们进一步引入了声明级优势(CLA-GRPO),它将 VR 阶段的部署分解为原子视觉声明,并基于视觉类型组形成在声明级别提供细粒度的优势。尽管分两个阶段进行训练,但训练后的策略的评估方式与 GRPO 模型类似,在推理时进行一次 CoT 调用。在此协议下,SPLIT-RL 比 GRPO 提高了平均准确度: Qwen3-VL 模型从 2B 到 30B-A3B 以及 InternVL3.5-8B 的 1.4-6.1 点。使用基于预言机的诊断评估每种功能表明,仅回答的 GRPO 保持感知不变,而 SPLIT-RL 则提高了 VR 和 LR。