论文

OmniThoughtVis:用于可部署多模态推理模型的可扩展 蒸馏 管道

OmniThoughtVis: A Scalable Distillation Pipeline for Deployable Multimodal Reasoning Models

摘要

最近的多模态 大语言模型 (MLLM) 在视觉语言任务上表现出了强大的思想链 (CoT) 推理能力,但它们在现实系统中的直接部署通常受到延迟和资源限制的限制。在实践中,较小的 MLLM 更适合在线服务,但由于缺乏大规模、高质量的多模态 CoT 监督,它们的推理性能受到瓶颈。在本文中,我们提出了 OmniThoughtVis,这是一种可扩展的数据管理和 蒸馏 管道,用于将多模态推理功能从大容量教师模型转移到更小的、面向部署的 MLLM。从多样化的开源种子池开始,我们的管道生成结构化的 CoT 跟踪,并对推理难度、答案质量和语义任务标签进行联合注释。为了大规模保持数据质量,我们结合了基于规则的过滤、难度感知选择和基于标签的多样性采样,生成了包含 180 万个样本的精选语料库,支持下游训练的可控子集构建。我们使用 OmniThoughtVis 从 2B 到 8B 参数提取 Qwen3-VL 模型,并在九个多模态推理基准上对其进行评估。由此产生的蒸馏模型在模型尺度上显示出一致的增益,包括 4B 模型在 MathVerse 上高达 +16.8 点的改进和在 MMMU-Pro 上 +5.6 点的改进。值得注意的是,经过蒸馏的 4B 模型在多项任务上匹配或超过了未经蒸馏的 8B 基线,凸显了可扩展推理 蒸馏 对于面向部署的 MLLM 的实用价值。