论文

多模态推理的数据管理最重要的是什么? DCVLR 挑战赛的见解

What Matters in Data Curation for Multimodal Reasoning? Insights from the DCVLR Challenge

模型训练合成数据

摘要

我们通过 NeurIPS 2025 视觉语言推理数据管理 (DCVLR) 挑战赛研究多模态推理的数据管理,该挑战通过修复模型和训练协议来隔离数据集选择。使用主要源自沃尔顿多模态冷启动的紧凑精选数据集,我们提交的内容在挑战中排名第一。通过赛后消融,我们表明在对齐的基础数据集上基于难度的示例选择是性能提升的主要驱动力。增加数据集大小并不能可靠地提高固定训练方案下的平均准确度,但主要会减少运行间方差,而常用的多样性和合成增强启发式方法不会提供额外的好处,并且通常会降低性能。这些结果将 DCVLR 描述为饱和状态评估,并强调了对齐和数据高效多模态推理中难度的核心作用。

固定训练协议下面向多模态推理的数据高效整理
图1:本次提交所用数据集整理流程总览,从基础数据集出发,经过滤、增强与最终采样。