论文
超越最终答案:面向透明多模态推理评测的CRYSTAL基准
Beyond Final Answers: CRYSTAL Benchmark for Transparent Multimodal Reasoning Evaluation
摘要
我们引入 **CRYSTAL**(*__C__lear __R__easoning via __Y__ielded __S__teps、__T__raceability 和 __L__ogic*),这是一个包含 6,372 个实例的诊断基准,可通过可验证的中间步骤评估多模态推理。我们提出了两个互补的指标:*Match F1*,它通过语义相似性匹配对步骤级精度和召回率进行评分,以及*Ordered Match F1*,它进一步惩罚无序的推理链。参考是通过德尔福启发的管道构建的,其中四个独立的 MLLM 生成轨迹,通过语义聚类进行聚合,并通过人类质量门进行验证。对 20 个 MLLM(包括在基准构建过程中未使用的商业前沿系统)的评估揭示了精度看不见的系统性故障:普遍的择优挑选(精度远远超过召回率)、非单调缩放权衡以及无序推理,其中没有竞争模型能够以正确的顺序保留超过 60% 的匹配步骤。除了评估之外,我们还提出了**因果过程奖励(CPR)**,这是一种将答案正确性与步骤级对齐相结合的乘法奖励,以及**CPR-课程**,它在训练过程中逐渐增加推理难度。 CPR-Curriculum 通过 GRPO 在附加奖励策略失败的情况下实现了 +32% 的匹配 F1,无需手动步骤注释即可改进推理。
