论文
观看的代价:在单一范式中实现值得信赖的多模态推理
The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm
摘要
视觉语言模型 (VLM) 的快速增长通常被认为能够实现统一的多模态知识发现,但其基础是一个未经充分检验的假设:当前的 VLM 忠实地综合了多模态数据。我们认为他们通常不这样做,这种差距反映了占主导地位的视觉编码器-投影仪-LLM 范例中的可信度问题。最先进的模型不是从视觉输入中提取基础知识,而是经常表现出功能性盲目性,即利用强大的语言先验来绕过严重的视觉表示瓶颈。在这项工作中,我们挑战了多模式评估的传统方法,该方法依赖于数据消融或新数据集创建,因此将数据集偏差与架构无能力混为一谈。我们提出了一种信息论的出发点:模态翻译协议,旨在量化我们所说的“观看费用”。通过翻译而不是消融语义负载,我们制定了三个新颖的指标——ToS (ToS)、Curse (CoS) 和 Seeing Fallacy (FoS)——最终形成语义充足标准 (SSC)。此外,我们假设多模态缩放的发散定律:随着底层语言引擎扩展到前所未有的推理能力,视觉知识瓶颈的惩罚可能会增加而不是减少。我们认为社区应该超越“多模式增益”作为主要评估目标。通过将 SSC 从被动诊断约束提升为主动架构蓝图,我们为引导下一代人工智能系统实现真正的多模态推理奠定了基础。