论文

位置就是您所需要的:基于 MLLM 的引用表达分割的免费午餐词元压缩策略

Position Is All You Need: A Free Lunch Token Compression Strategy for MLLM-based Referring Expression Segmentation

模型推理推理加速

摘要

引用表达分割(RES)旨在从复杂和隐式文本查询生成像素级分割掩码。虽然多模态 大语言模型 (MLLM) 的最新进展极大地提高了 RES 性能,但其令人望而却步的计算开销仍然是一个关键瓶颈,但很少有人对此进行探讨。为了填补这一空白,我们首先评估此任务的典型词元压缩方法,并观察到令人惊讶的性能下降。在本文中,我们旨在了解这一现象并寻求解决方案。通过大量实验,我们发现 RES 的 token 压缩需要保留原始位置嵌入和局部相邻空间结构,这表明视觉 token 位置信息比其他任务更为重要。基于这一见解,我们问:我们可以纯粹基于位置信息来设计词元压缩方法吗?因此,我们提出 PAYN,一种即插即用、仅依赖位置信息的 无需训练 词元压缩方法。 PAYN保留了充分分布在每个局部相邻区域的词元,同时严格保留原始位置索引,从而保持空间关系一致性。对多个 RES 基准的实验表明,我们的方法优于现有的词元压缩方法,验证了该位置确实是基于 MLLM 的 RES 任务中词元压缩所需的全部内容。代码可在 https://github.com/YuhanLiu231/PAYN 获取。