论文
TuringViT:让所有人都能接触到 SOTA Vision Transformer
TuringViT: Making SOTA Vision Transformers Accessible to All
摘要
现代 VLM 和 VLA 系统通常采用现成的 ViT(例如 SigLIP2)作为视觉编码器,但延迟、时间建模和 VLM 集成方面的不同下游需求通常需要定制的 SOTA 级 ViT。训练这样的编码器仍然超出了社区大部分人的能力范围,因为它需要大量的图像文本数据,而标准的 softmax 注意力使得高分辨率或动态分辨率预训练的成本过高,并且常常迫使低分辨率预训练,然后进行事后适应。 TuringViT 通过三个关键设计解决了这些挑战:用于高效序列建模的图灵线性注意力 (TLA)、用于构建监督丰富的图像视频训练数据的 VISTA-Curation,以及从一开始就支持灵活输入并无缝传输到下游 VLM 的原生动态分辨率预训练。因此,TuringViT 仅用 10% 的数据就超越了领先的开源 ViT 基线,实现了更强的下游 VLM 性能,并在高分辨率输入上提供了更好的延迟扩展。我们的缩放定律分析进一步表明,TuringViT 通过精心策划的数据规模继续以可预测的方式改进,远未达到饱和。其快速适配、硬件友好的设计和高效的部署使其成为小鹏AI系统的统一视觉基础。更广泛地说,TuringViT 提供了一个可重复的管道,大大降低了社区训练、定制和部署 SOTA 级 ViT 的成本,从而使所有人都能使用此类 Vision Transformer。