论文

Where-OPD:具有合成场景的 MLLM 的空间引导按​​策略自蒸馏

Where-OPD: Spatially Guided On-Policy Self-Distillation of MLLMs with Synthetic Scenes

摘要

政策自我蒸馏最近已成为一种改进语言模型推理的有效方法,它通过接收特权信息的冻结或 EMA 版本的自身来监督学生。然而,它在多模态大语言模型(MLLM)中的应用在很大程度上仍未得到探索。最近的方法使用特权视觉信息(例如与问题相对应的图像裁剪)来改善细粒度感知,但它们的收益仅限于受益于此类视觉缩放并需要人工注释的基础数据或外部教师模型的任务。我们为 MLLM 引入了一种不同形式的策略自蒸馏,为教师提供文本、基于空间的指导,识别与查询相关的视觉元素。我们使用程序生成的场景以及自动可用的对象标识和空间坐标,从而实现可扩展且无注释的后训练。教师使用这种空间指导来定位和整合来自多个相关图像区域的证据,而学生则学习仅从图像和问题中重现由此产生的行为。我们的方法不断提高跨多个模型的计数、文档和图表理解基准的性能。重要的是,尽管后训练仅使用合成场景,但由此产生的改进会转移到现实世界的感知基准,使 CVBench、V*、ZoomBench、BLINK、HR-Bench 和 MME-RealWorld 的平均性能提高 3.23 点。这些结果表明,基于空间的特权信息可以通过策略自蒸馏诱导更广泛的感知能力,从而实现超出用于后训练的任务和数据分布的大量合成到真实的传输。项目页面:https://github.com/sirkosophia/Where-OPD