论文

PixVL:通过统一掩模进行像素级 MLLM 的自监督训练——文本一致性循环

PixVL: Self-Supervised Training of Pixel-Level MLLMs via a Unified Mask--Text Consistency Cycle

模型训练奖励建模与过程监督

摘要

最近的研究开发了像素级多模态 大语言模型 (MLLM),支持区域分割和区域理解,将多模态交互从整个图像扩展到特定对象和区域。然而,这些方法面临两个基本挑战。首先,高质量掩模文本对的稀缺导致丰富的掩模注释没有相应的语言监督。其次,监督格式和学习信号密度的差异会导致区域分割和区域理解之间的优化干扰。为了应对这些挑战,我们提出了 PixVL,这是一个自我监督的 后训练 框架,它引入了统一的 Mask——文本一致性循环,使像素级 MLLM 能够生成和自我验证区域描述,并从未标记的数据中学习。我们发现仅基于几何重建的直接循环是不可靠的,因为重新分割 IoU 不能忠实地反映语义质量和引用充分性。因此,PixVL 引入了混淆感知语义验证,该验证在模型在高度相似的候选区域中正确选择目标时使用模型的置信度,并对错误的选择分配零奖励。同时,PixVL 使用时间分离的视频帧或几何变换的图像视图执行跨视图验证,防止循环学习崩溃为位置和形状快捷方式。最后,质量耦合的双向学习策略使用最高奖励描述来指导文本到掩模的学习。该策略将区域理解和区域分割从竞争任务转变为相互生成器和验证器。实验表明,PixVL 改善了区域理解任务和分割任务。