论文

超越最终答案:面向透明多模态推理评测的CRYSTAL基准

Beyond Final Answers: CRYSTAL Benchmark for Transparent Multimodal Reasoning Evaluation

模型评测模型训练强化学习基准与评测资源RLVR

摘要

我们引入 **CRYSTAL**(*__C__lear __R__easoning via __Y__ielded __S__teps、__T__raceability 和 __L__ogic*),这是一个包含 6,372 个实例的诊断基准,可通过可验证的中间步骤评估多模态推理。我们提出了两个互补的指标:*Match F1*,它通过语义相似性匹配对步骤级精度和召回率进行评分,以及*Ordered Match F1*,它进一步惩罚无序的推理链。参考是通过德尔福启发的管道构建的,其中四个独立的 MLLM 生成轨迹,通过语义聚类进行聚合,并通过人类质量门进行验证。对 20 个 MLLM(包括在基准构建过程中未使用的商业前沿系统)的评估揭示了精度看不见的系统性故障:普遍的择优挑选(精度远远超过召回率)、非单调缩放权衡以及无序推理,其中没有竞争模型能够以正确的顺序保留超过 60% 的匹配步骤。除了评估之外,我们还提出了**因果过程奖励(CPR)**,这是一种将答案正确性与步骤级对齐相结合的乘法奖励,以及**CPR-课程**,它在训练过程中逐渐增加推理难度。 CPR-Curriculum 通过 GRPO 在附加奖励策略失败的情况下实现了 +32% 的匹配 F1,无需手动步骤注释即可改进推理。

超越最终答案:面向透明多模态推理评测的CRYSTAL基准:论文配图
图 1:幸运猜测问题。 LLaVA-v1.6-7B 正确回答(C),但自相矛盾,声称中间控制台较大,而选择它为最小。之前的基准测试得分为 100%; CRYSTAL 通过 Match F1 (0.15) 将模型的预测步骤与参考推理步骤进行比较,暴露推理的缺陷。