论文
RADIO1D:压缩视觉建模的弹性表示
RADIO1D: Elastic Representations for Condensed Vision Modeling
摘要
本文挑战了视觉语言模型 (VLM) 需要固定的基于补丁的 2D 视觉特征的假设。通过分析微调视觉编码器,我们发现在 VLM 训练期间表示变得越来越抽象且空间连贯性越来越差。值得注意的是,经过图像文本对齐训练的模型(例如 SigLIP2)开发了少量专门的标记,可以有效地总结全局图像内容。在此基础上,我们引入了 RADIO1D,它使用多教师 知识蒸馏 和自动编码器设计将图像压缩为紧凑的、可变长度的一维词元序列。由此产生的表示表现出强大的层次概括,即使使用单个标记也能实现准确的场景理解,并支持改进的构图感知图像检索。在 VLM 中,RADIO1D 通过可调整的词元计数提供灵活的精度与效率权衡,在不同的多模式基准上提供具有竞争力的性能,同时具有更低的计算开销和更高的精度。