论文
GraSP-VL:长度作为视觉语言表示的语义粒度接口
GraSP-VL: Length as a Semantic Granularity Interface for Vision-Language Representations
摘要
冻结的视觉语言嵌入包含多种语义分辨率的信号,从对象身份到属性、关系和完整标题含义,但它们通过固定长度的向量接口公开这些信号。我们研究嵌入长度是否可以变成可控的语义访问接口。我们提出 \textbf{GraSP-VL},它在冻结的 VLM 嵌入上学习共享的近正交前缀变换。 GraSP-VL 实例化了一个 \textbf{Semantic Matryoshka} 接口:短前缀被分配粗略的语义角色,而较长的前缀则逐渐暴露出更精细的基于语言的区别。由于变换在图像和文本嵌入之间共享并保留全维几何形状,因此前缀行为会发生变化,而无需重写原始 VLM 空间。在包含 20,147 个示例的 COCO/Flickr30K 注释池上,GraSP-VL 的阶梯得分为 53.01,硬阴性选择性为 89.76,同时将全空间漂移保持在 $10^{-6}$ 以下。它还以 86.03 的对象精度和 11.96 的平均外部出现率转移到 SugarCrepe-clean,并保留全维零样本 CIFAR-100 精度。这些结果表明,冻结的 VLM 嵌入可以重新组织为可截断的语义前缀接口,而不仅仅是压缩。