论文
PolarVLM:弥合视觉语言模型中的语义物理差距
PolarVLM: Bridging the Semantic-Physical Gap in Vision-Language Models
摘要
由于标准 RGB 输入的固有限制,主流视觉语言模型 (VLM) 从根本上与严重的光学模糊性作斗争,例如反射和透明物体。虽然偏振成像捕获的偏振物理参数可以解决这些模糊性,但现有方法受到固定格式输出的限制,并且与开放式推理保持隔离。为了弥合这种语义-物理差距,我们引入了 PolarVLM,这是第一个将极化物理参数集成到 VLM 中的多模态框架。通过采用双流架构和渐进式两阶段训练策略,PolarVLM 有效防止物理误解,同时保留一般视觉能力。为了补充我们的架构,我们构建了 PolarVQA,这是偏振感知 VQA 的第一个基准,具有 75K 个基于物理的指令调整对,针对反射和透明场景。实验表明,PolarVLM 在五项评估任务中总体超出 RGB 基线 25.4%,反射识别方面显着提高 26.6%,玻璃计数方面提高 34.0%,成功解锁了物理感知语义理解。