论文

S1-VL:具有图像思维的科学多模态推理模型

S1-VL: Scientific Multimodal Reasoning Model with Thinking-with-Images

模型推理推理策略与问题分解

摘要

我们提出了 S1-VL,一种针对科学领域的多模态推理模型,它本身支持两种互补的推理范式:科学推理(依赖于结构化思维链)和图像思考(使模型能够在推理过程中通过 Python 代码执行主动操作图像)。在图像思考模式下,模型在沙箱环境中生成并执行图像处理代码,获得中间视觉结果,并以多轮迭代的方式继续推理。这种设计对于高分辨率科学图表解释、显微图像理解和几何辅助推理等具有挑战性的场景特别有效。为了构建训练数据,我们收集了跨越六个学科的科学多模式数据集:数学、物理、化学、天文学、地理学和生物学。我们进一步开发了用于推理轨迹的六维质量过滤框架。为了减少现有数据集中常见的冗余、无效和错误的视觉操作,我们提出了多级过滤管道以及自适应数据路由策略。该策略将视觉信息增益低的样本转换为纯推理模式数据,使模型能够在真正需要图像操作时进行学习。 S1-VL 通过四阶段渐进式管道进行训练:科学多模式 SFT、图像思维冷启动 SFT 以及 SAPO 强化学习的两个阶段。我们在 Qwen3-VL-32B-Thinking 之上构建了 S1-VL-32B,并在 13 个基准测试中对其进行了评估。实验结果表明,S1-VL-32B 在所有五个 Thinking-with-Images 基准测试(包括 HRBench-4K、HRBench-8K、MME-RealWorld-CN、MME-RealWorld-Lite 和 V*)上均实现了最先进的性能,并且在物理和 VRSBench 等科学推理基准测试中优于对比系统。