论文

LocateAnything:通过并行盒解码实现快速、高质量的视觉语言基础

LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding

模型推理解码与生成控制

摘要

视觉语言模型 (VLM) 通常将视觉基础和检测表述为坐标词元生成问题,将每个 2D 框序列化为多个 1D 词元,这些词元在很大程度上独立学习和解码。这种逐个词元的解码与盒几何形状的耦合结构不匹配,并且由于严格的顺序生成而产生了实际的推理瓶颈。我们介绍 LocateAnything,这是一个基于并行盒解码 (PBD) 的统一生成定位和检测框架。通过一步将边界框和点等几何元素解码为原子单元,LocateAnything 保留了框内几何一致性并释放了实质性的并行性。我们表明 PBD 提高了解码吞吐量和定位精度。我们进一步开发了可扩展的数据引擎,并策划了 LocateAnything-Data,这是一个包含超过 1.38 亿个训练样本的大型数据集,大大增加了高精度定位的数据多样性。广泛的评估表明,LocateAnything 推进了速度精度前沿,实现了显着更高的解码吞吐量,同时提高了跨不同基准的高 IoU 定位质量。结果强调了并行盒解码和大规模训练数据在实现高效、精确的统一视觉基础和检测方面的互补优势。