论文
VisionFoundry:使用合成图像教授 VLM 视觉感知
VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images
摘要
视觉语言模型(VLM)仍然难以解决空间理解和视点识别等视觉感知任务,这主要是因为自然图像数据集对底层视觉技能的监督有限。有针对性的综合监督可以在没有参考图像或手动注释的情况下解决这些弱点吗?为了研究这个问题,我们引入了 VisionFoundry,这是一个自动化管道,仅将任务名称作为输入,使用 LLM 合成配对问题、答案和文本到图像 (T2I) 提示,使用 T2I 模型生成图像,并通过多模式验证过滤样本。通过 VisionFoundry,我们构建了 VisionFoundry-10k,这是一个涵盖 10 个感知任务的合成 VQA 数据集。 VisionFoundry-10k 上的微调持续改进了三个开源主干网的感知基准(例如,Qwen2.5-VL-3B-Instruct 在 MMVP 对上 +6.7%,在 CV-Bench-3D 上 +10.5%),同时保留更广泛的功能并显示出积极的数据扩展。相同的综合监督还在所有三个主干的强化学习(RL)下产生了一致的收益,并且该框架在开源综合和自我验证下仍然有效。我们的研究结果表明,自动化综合监督为系统性 VLM 训练提供了一条有效且可扩展的途径。