论文
洞穴寓言:测量依据对齐的视觉-语言学习
Allegory of the Cave: Measurement-Grounded Vision-Language Learning
摘要
视觉-语言模型通常在经过ISP处理后的RGB图像上进行推理,尽管RGB渲染可能在推理之前截断、抑制或量化传感器证据。我们研究当视觉接口向底层相机测量靠近时,接地能力是否会改善。我们形式化了测量接地的视觉-语言学习,并将其实例化为PRISM-VL,它结合了由RAW导出的Meas.-XYZ输入、相机条件化接地,以及用于将监督从RGB代理迁移到测量域观测的包围曝光监督聚合(Exposure-Bracketed Supervision Aggregation)。使用经过质量控制的150K指令微调集和针对低光、HDR、可见度敏感与幻觉敏感案例的保留基准,PRISM-VL-8B达到0.6120 BLEU、0.4571 ROUGE-L和82.66%的LLM-Judge准确率,相比RGB Qwen3-VL-8B基线提升+0.1074 BLEU、+0.1071 ROUGE-L和+4.46个百分点。这些结果表明,VLM接地误差的一部分源于RGB渲染过程中的信息损失,而保留测量域证据可以改善多模态推理。
