论文
T-REN:学习文本对齐区域标记提高了密集视觉语言对齐和可扩展性
T-REN: Learning Text-Aligned Region Tokens Improves Dense Vision-Language Alignment and Scalability
摘要
尽管最近取得了进展,但视觉语言编码器仍面临两个核心限制:(1)语言和密集视觉特征之间的弱对齐,这会损害开放词汇语义分割等任务; (2) 细粒度视觉表示的高词元计数,这限制了长视频的可扩展性。这项工作解决了这两个限制。我们提出了 T-REN(文本对齐区域编码器网络),这是一种高效的编码器,可将视觉数据映射到一组紧凑的文本对齐区域级表示(或区域标记)。 T-REN 通过在冻结视觉主干之上添加一个轻量级网络来实现这一目标,该网络经过训练,可以将每个语义区域内的补丁级表示汇集到区域标记中,并将它们与区域级文本注释对齐。与视觉语言主干相比,该设计仅增加了 3.7% 的额外参数,可产生更强的密集跨模式理解,同时将标记数量减少几个数量级。具体来说,T-REN 在 ADE20K 开放词汇分割上提供了 +5.9 mIoU,在 COCO 对象级文本图像检索上提供了 +18.4% 的召回率,在 Ego4D 视频对象定位上提供了 +15.6% 的召回率,在 VSPW 视频场景解析上提供了 +17.6% mIoU,同时与基于补丁的视觉语言主干相比,将图像的标记计数减少了 24 倍以上,视频的标记计数减少了 187 倍以上。代码和模型可在 https://github.com/savya08/T-REN 获取。