论文
余弦误导:辅助损失重塑视觉语言模型,而不是它们的潜伏
Cosine Misleads: Auxiliary Losses Reshape Vision Language Models, Not Their Latents
摘要
潜在视觉推理 (LVR) 在视觉语言模型 (VLM) 的感知和答案生成之间插入受监督的潜在标记。该领域使用这些潜在变量与其视觉目标之间的对齐,即余弦相似度或均方误差(MSE),作为训练损失和质量度量,假设更好的对齐会产生更好的答案。我们使用五个 LVR 变体的设计矩阵对此进行测试,并发现假设相反:余弦对齐与所有五个变体的准确度呈负相关(r=-0.94)。为了解释这一点,我们引入了 PRISM,这是一对推理时间诊断:一个询问答案在哪里可解码的线性探针,以及一个询问潜在变量是否可承载的损坏测试。受监督的潜在因素很大程度上被绕过。破坏它们最多会使准确度降低四点。答案是在潜伏下游可解码的,但在潜伏下游则不然,这种可解码性差距的大小预测了每个变体在扰动下对其潜伏的依赖程度。与损失的信息瓶颈读数一致,辅助目标通过共享参数而不是通过其名义上优化的潜在变量来重塑语言模型。