论文

DeltaV:在统一大型多模态模型中考虑视觉状态更新

DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models

模型架构新型架构

摘要

当前的统一大型多模态模型 (ULMM) 通过文本推理和中间视觉状态支持交错多模态推理,但通常将每个视觉状态生成为完整图像。这种全图像生成范式引入了大量的视觉标记冗余,并削弱了对稀疏但推理关键的状态转换的监督。我们提出了 DeltaV,一种用视觉更新代替全图像生成的 ULMM。以历史视觉状态为条件,DeltaV 增量预测紧凑的更新标记,捕获推理步骤中的视觉变化,避免对未更改的内容进行重复建模。为了使每次更新的 词元预算 与视觉变化的幅度保持一致,DeltaV 引入了时间相似性 (TSIM) 路由器,一旦边际重建增益低于阈值,该路由器就会停止分配词元。为了支持更加多样化和泛化的推理,我们进一步构建了 StructCoT,这是一个大规模交错多模态推理数据集,包含 105 万个样本,涵盖 44 个任务域。实验表明,视觉更新范式在不影响重建保真度的情况下平均减少了新生成的视觉标记 55.6%,并且比全图像生成提高了多模态推理 3.3%。使用 StructCoT 和大规模多模态数据进行训练后,DeltaV-2B 在域内多模态推理评估方面比规模更大的开源模型进一步领先 8.4%,在外部多模态推理和理解基准方面比同等规模的 Qwen3-VL-2B 领先 5.9%。代码、模型和StructCoT将在https://github.com/Pengjie-W/DeltaV发布。