论文

读出不是恢复:从视觉语言模型中的视觉损坏修复中分离坐标发射

Readout is not Recovery: Dissociating Coordinate Emission from Visual-Corruption Repair in Vision-Language Models

模型评测模型行为与机制分析

摘要

VLM 边界框定位既是语言生成也是空间承诺。 bbox_2d 等可解析字段使定位易于评分,但发出坐标标记的维度在视觉证据损坏后无需修复定位。我们在单对象 COCO grounding的 Qwen3-VL-4B-Instruct 中研究了这种读出/恢复分离。我们将干净的坐标词元读出排名与损坏衍生的修复排名进行比较,使用对象掩码端点替换进行恢复,使用干净输入地板进行深度定位。在 Qwen3-VL 中,坐标词元排序在第 24 层是惰性的,从第 32-35 层开始是承载的,在第 34 层达到峰值;腐败衍生的排名会损害第 16-24 层,但在第 35 层/最终层附近变得有益。尽管盒子格式不同,Kimi-VL-A3B 诊断显示匹配的输出近端转换。对象掩码恢复将排名预算分开:$k=250$ 显示必要性,$k=500$ 显示高于随机的 Top-$k$ 恢复,而 $k=d/2$ 很大程度上是容量驱动的。部分遮挡扫描表明,高重叠的坐标标记集可能会在 $k=1000$ 时受到损害,并且主要在半宽时有所帮助,而群体损坏派生集不提供可靠的固定修复集。边缘归因修补显示坐标标记路径精度高,但检测恢复的召回率低,并且 RMSNorm 准层控件不能缩小端点修复差距。因此,端点坐标分类是一个有用的电路先验,但遮挡恢复需要单独的基准。