论文

消融验证:视觉语言模型真的使用连续思维标记吗?

Ablate-to-Validate: Are Vision-Language Models Really Using Continuous Thought Tokens?

模型评测模型行为与机制分析

摘要

视觉语言模型(VLM)越来越多地通过连续或潜在的非文本标记来增强,旨在支持“视觉思维”。尽管任务准确性得到了提高,但这并不能表明模型实际上使用这些标记进行推理——收益可能来自于诸如增加上下文长度、特殊标记锚定或训练时间正则化等混杂因素。我们形式化了一个诊断原则,Ablate-to-Validate,用于测试潜在词元内容是否被真正利用,并将其实例化为词元替换测试(TRT),这是一套标准化的内容替换消融。 TRT 固定提示、图像、词元预算 和解码,同时用零、随机、首次重复或预言替代方案替换中间词元,从而隔离性能是否取决于词元内容或仅取决于词元存在。作为受控测试平台,我们使用 LLaVA-13B 和 Qwen2.5-VL-3B 研究相对深度推理,训练模型来预测和消耗跨多个冻结编码器(SigLIP2、CLIP、DINOv2)和 词元预算 的连续或离散深度跨度。我们还将 TRT 应用于 BLINK、VSP 和 CV-Bench 上的三个现成的视觉思维系统(Mirage、Mull-Tokens、CoVT)。在所有设置中,准确性增益都是潜在词元推理的误导性代理:即使词元内容被损坏或替换,VLM 仍保留大部分改进,揭示了拥有潜在通道和将其用作信息瓶颈之间的持续差距。我们建议将 TRT 作为标准诊断以及任何引入连续思维标记的方法的准确性。