论文

SeePhys Pro:诊断物理推理多模态RLVR中的模态迁移与盲训效应

SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning

模型评测模型训练强化学习基准与评测资源RLVR

摘要

我们推出了 SeePhys Pro,这是一种细粒度模态转移基准,用于研究当关键信息逐步从文本转移到图像时模型是否保留相同的推理能力。与评估单一输入形式的标准视觉基本基准不同,SeePhys Pro 针对每个问题提供四种语义对齐的变体,并逐渐增加视觉元素。我们的评估表明,当前的前沿模型远非表示不变的推理机:随着信息从语言转移到图表,性能平均下降,而视觉变量基础是最关键的瓶颈。受这种推理时间脆弱性的推动,我们进一步开发了用于多模态 RLVR 的大型训练语料库,并使用盲训练作为诊断控制,发现所有训练图像被屏蔽的 RL 仍然可以提高未屏蔽验证集的性能。为了分析这种效果,文本删除、图像掩模率和格式饱和度控制表明,这种增益可能来自残留的文本和分布线索,而不是有效的视觉证据。我们的结果强调了评估多模态推理的必要性,不仅要通过最终答案的准确性,还要通过模态转移下的稳健性以及测试改进是否依赖于任务关键型视觉证据的诊断来评估。

SeePhys Pro:诊断物理推理多模态RLVR中的模态迁移与盲训效应:论文配图
图 1:SeePhys Pro 中四个模态传输级别的概述。每个种子问题都转化为四个语义对齐的变体,逐步将问题关键信息从语言转移到视觉:第 1 级仅包含文本,第 2 级将结构移动到图像中,第 3 级进一步将变量和标签移动到图像中,第 4 级将整个问题呈现为单个视觉输入。