论文

PGT:程序生成的任务,用于改善 MLLM 中的视觉基础

PGT: Procedurally Generated Tasks for improving visual grounding in MLLMs

模型训练合成数据

摘要

尽管多模态 大语言模型 (MLLM) 取得了显着进展,但这些模型仍然难以完成细粒度的理解任务。在这项工作中,我们提出了程序生成的任务(PGT),这是一个简单的数据驱动框架,具有双重目的:诱导细粒度的视觉理解并充当识别感知失败根源的低成本诊断工具。通过在图像上叠加明确的几何基元,PGT 生成额外的密集监督,将视觉基础能力与语义先验分开。关于关系、定量和 3D/深度理解基准的大量实验表明,PGT 在不同的架构中产生了显着的收益。使用 PGT 数据增强的 LLaVA-v1.5-Instruct 上的指令调整 MLLM 可在 What'sUp 基准上提高高达 +20%,在 CV-Bench-2D 上提高 13.3%,同时保持一般感知能力。此外,根据 PGT 数据对最先进的 MLLM 进行微调,可使 What'sUp 提升高达 +5.5%,使 CV-Bench-2D 提升高达 +8.3%。这些发现表明,PGT 有效解决了细粒度感知的瓶颈,揭示了许多空间推理缺陷源于监督信号不足,而不是固有的架构或分辨率限制。