论文
冻结的 VLM 何时响应无图像对象标记编辑?无答案密钥协议及其揭示的内容
When Do Frozen VLMs Respond to Image-Free Object-Token Edits? An Answer-Key-Free Protocol and What It Reveals
摘要
使用 VLM 回答有关场景的假设查询通常意味着将假设注入为文本或使用生成模型重新绘制场景。相反,我们将编辑移至模型输入之前的表示级别。图像被抽象为一组对象级标记,原始图像永远不会进入 VLM。这种设计基于一个悬而未决的问题:冻结的 VLM 何时真正响应此类词元编辑?我们引入了无答案键协议:没有注释后编辑答案。它对答案按逻辑确定的编辑进行评分,并通过反转每个可评分的选择来审核自身。该协议揭示了三种结构。答案不是免费的:显式编辑教学,而不是普通的 VQA 训练,在所有三种操作中在密集场景中产生它并在稀疏场景中相乘。一旦启动,它就受到词元清洁度和密度的控制,可部署的检测器+分段器词元可与预言机竞争,并在 VRSBench 上超越它。阅读是一个可分离的轴:无图像标记路径保留了匹配补丁标记基线的自由文本 VQA 的 92-96%,并且答案在很大程度上取决于标记。响应、清洁度和读取结构在两个遥感数据集(iSAID、VRSBench)和三个冻结的 LM 主干中保留符号。我们发布了探针生成器、记录、判断日志和代码。