论文
解剖:诊断科学 VLM 中视觉结束和语言先验开始的位置
DISSECT: Diagnosing Where Vision Ends and Language Priors Begin in Scientific VLMs
摘要
当被要求描述分子图时,视觉语言模型正确识别“带有-OH基团的苯环”。当被要求推理同一图像时,它回答错误。模型可以看到,但无法思考所看到的内容。我们将其称为感知-集成差距:视觉信息被成功提取但在下游推理过程中丢失的失败,对于将感知与集成混为一谈的单一配置基准来说是不可见的。为了系统地揭露此类失败,我们引入了 DISSECT,这是一个涵盖化学 (7,000) 和生物学 (5,000) 的 12,000 个问题诊断基准。每个问题都在五种输入模式下进行评估——视觉+文本、纯文本、纯视觉、人类预言机和一种新颖的模型预言机,其中VLM首先用语言描述图像,然后根据自己的描述进行推理——产生诊断差距,将性能分解为语言优先利用、视觉提取、感知保真度和集成有效性。通过评估 18~VLM,我们发现:(1)化学的语言先验可利用性明显低于生物学,这证实了分子视觉内容是真正视觉推理的更难测试; (2)开源模型根据自己的语言描述进行推理时的得分始终高于根据原始图像进行推理的得分,从而暴露了系统集成瓶颈; (3)闭源模型没有显示出这样的差距,这表明桥接感知和集成是区分开源与闭源多模式能力的前沿。 Model Oracle 协议与模型和基准无关,可事后适用于任何 VLM 评估以诊断集成故障。