论文
揭示细粒度视觉痕迹:评估多模态 STEM 任务中的多模态交错推理链
Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks
摘要
多模态 大语言模型 (MLLM) 已显示出有前景的推理能力,但评估其在专业领域的表现仍然具有挑战性。 STEM 推理是一个特别有价值的测试平台,因为它提供了高度可验证的反馈,但现有基准通常由于模态冗余而允许单模态捷径,并且主要关注最终答案的准确性,而忽略了推理过程本身。为了应对这一挑战,我们引入了 StepSTEM:一个涵盖数学、物理、化学、生物学和工程领域 283 个问题的研究生水平基准,用于对 MLLM 中的跨模式推理进行细粒度评估。 StepSTEM 通过严格的管理流程构建,强制文本和视觉输入之间严格互补。我们进一步提出了一个适用于纯文本思维链和交错图像文本推理的通用步骤级评估框架,使用动态编程将预测的推理步骤与多个参考解决方案对齐。各种模型的实验表明,当前的 MLLM 仍然严重依赖文本推理,甚至 Gemini 3.1 Pro 和 Claude Opus 4.6 的准确率也仅为 38.29%。这些结果凸显了真正的跨模态 STEM 推理的巨大空间,并将 StepSTEM 定位为多模态推理细粒度评估的基准。源代码可在 https://github.com/lll-hhh/STEPSTEM 获取。