论文

DRScaffold:在轻量级视觉语言模型中促进密集场景推理

DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models

模型训练监督微调与指令调优

摘要

轻量级视觉语言模型在标准基准上具有竞争力,但在密集场景推理中系统性地失败,其中多个对象、属性和关系必须通过多步骤推理共同建立和解决。这种能力对于模型必须可靠地解释混乱环境的现实应用程序至关重要。然而,现有的训练信号在推理步骤与底层视觉实体和关系之间没有提供明确的基础,使得轻量级模型可以自由地生成流畅但视觉上无锚定的推理链。为了解决这一差距,我们首先引入 DRBench,这是一个涵盖 2,943 张图像的 14,573 个问题的基准,被组织成跨越三个渐进推理层的五个任务类别。在 DRBench 的基础上,我们提出了 DRScaffold,这是一个受监督的 微调 框架,它将监督目标分解为四个因果顺序的阶段,在不进行架构修改的情况下强制执行扎根推理。对三个轻量级 VLM 进行的实验表明,DRBench 取得了显着的进步,同时保留或提高了通用基准测试的性能。值得注意的是,使用 DRScaffold 训练的 Qwen2.5-VL-3B 超过了 DRBench 上冻结的 Qwen2.5-VL-32B,这表明结构化监督可以替代密集场景推理中模型规模的很大一部分。我们的代码和模型可在 https://github.com/irene-shi/DRScaffold 获取。