论文

洞穴寓言:测量依据对齐的视觉-语言学习

Allegory of the Cave: Measurement-Grounded Vision-Language Learning

模型训练监督微调与指令调优

摘要

视觉-语言模型通常在经过ISP处理后的RGB图像上进行推理,尽管RGB渲染可能在推理之前截断、抑制或量化传感器证据。我们研究当视觉接口向底层相机测量靠近时,接地能力是否会改善。我们形式化了测量接地的视觉-语言学习,并将其实例化为PRISM-VL,它结合了由RAW导出的Meas.-XYZ输入、相机条件化接地,以及用于将监督从RGB代理迁移到测量域观测的包围曝光监督聚合(Exposure-Bracketed Supervision Aggregation)。使用经过质量控制的150K指令微调集和针对低光、HDR、可见度敏感与幻觉敏感案例的保留基准,PRISM-VL-8B达到0.6120 BLEU、0.4571 ROUGE-L和82.66%的LLM-Judge准确率,相比RGB Qwen3-VL-8B基线提升+0.1074 BLEU、+0.1071 ROUGE-L和+4.46个百分点。这些结果表明,VLM接地误差的一部分源于RGB渲染过程中的信息损失,而保留测量域证据可以改善多模态推理。

洞穴寓言:测量接地的视觉-语言学习:论文配图
图 1:传统 RGB 渲染可能会丢弃任务关键型视觉证据。对于每个示例,我们都会比较 Meas.-XYZ 观测值、其传统渲染的 RGB 视图、RGB 渲染和逆处理后无法恢复的信号、丢失信号残差的局部裁剪以及相应的亮度分布。在第四列中,蓝色区域标记了测量域观察中存在但在 RGB 渲染和逆恢复后丢失的视觉信号。残差和裁剪显示,该缺失信号集中在回答问题所需的照明文本区域,表明 RGB 图像不再保留接地的关键测量域证据。