论文
PhysAlign:区分物理图识别与实体关系对应能力
PhysAlign: A Benchmark for Evidence-Grounded Role Alignment in Multimodal Physics Reasoning
摘要
理解物理图的一个关键挑战是将视觉信息与其描述的物理实体、关系和条件正确关联起来。即使准确识别了值、符号或其他局部元素,将其分配给错误的实体或范围也可能会扭曲潜在的物理前提并导致错误的推理。为了系统地研究这一挑战,我们引入了 PhysAlign,这是一个基准,旨在评估多模态模型是否正确将从物理图中识别的信息与其预期的物理角色相关联。通过局部探针和受控变体将视觉识别与物理角色分配分开,PhysAlign 将对应错误与识别失败隔离开来。它包含 3,341 个经过人类验证的探针,涵盖 986 个物理问题,能够大规模地系统评估视觉识别和物理角色对应关系。我们进一步引入了五个互补的评估指标,包括 CAcc、GAcc 和 JAcc,它们对模型识别图表内容、建立正确的物理对应关系和解决潜在物理问题的能力进行全面评估。在我们评估的多模态模型中,PhysAlign 揭示了局部视觉识别和物理角色基础之间始终存在的差距。即使正确识别了查询内容,GPT-6-Astra 的条件对应错误率仍为 13.8%,而 InternVL3.5-8B 则上升至 50.6% 左右。这些发现表明,仅靠强烈的感知并不能确保可靠的物理解释,暴露了一个明显的基础瓶颈,该瓶颈很大程度上被答案级别的准确性所隐藏,并强调未来模型需要更好地将公认的视觉证据与其物理意义结合起来。