论文
将视觉语言模型中的感知与推理分开:晶体结构的无模型渲染上限
Separating perception from reasoning in vision-language models: a model-free render ceiling for crystal structures
摘要
多模态评估无法判断视觉语言模型是否误读了图像或对图像进行了错误推理,因为现有的每种分离两者的方法都会在循环中放置第二个模型。我们引入了渲染上限,这是通过渲染已知对象构建的基准的无模型参考:反转冻结的相机并重新解决交叉视图对应关系可以准确地恢复图像支持的答案。我们仅通过一组可枚举的投影巧合来证明天花板失效,并证明在 2,160 个渲染的晶体结构上设置为空,因此模型缺陷的每个点都属于该模型。在 14 个视觉语言模型中,提供精确的几何图形作为文本提升了每个模型,但将 13 个模型的差距缩小到一半以下,而没有语言组件的监督视觉模型以 0.8952 读取相同的图像,高于每个视觉语言模型。该仪器暴露了提取阶段的制造过程,下游的准确性会被错误地归因于推理,为基准构建者生成相机放置规则,并通过可逆的前向渲染转移到任何基准。