论文
关于视觉语言模型的测试时间缩放
On Test-Time Scaling for Vision-Language Models
摘要
测试时间缩放是一种范例,其中大型模型在推理时使用额外的计算来实现更好的性能,而不改变模型权重。虽然它已针对 大语言模型 (LLM) 进行了广泛研究,但其对大型视觉语言模型 (LVLM) 的适用性仍然较少探索和分析,对这些方法是否、何时以及在多大程度上转移到 LVLM 的分析有限。在这项工作中,我们提出一个简单但基本的问题:为 LLM 开发的传统测试时间缩放方法是否可以直接应用于 LVLM?我们首次对 LVLM 测试时间缩放进行全面研究,涵盖多种模型和模型大小、九种测试时间缩放方法和六种不同的基准。我们的主要发现是:1) 与之前的发现不同,性能良好的小型模型从测试时间扩展中获益最多,性能提升高达 30% 左右,达到大型模型的性能,并且通常表现优于大型模型;2) 当给予超过必要的计算量时,LVLM 会失去焦点;3) 视觉信息在推理链的早期进行编码,之后该链以纯文本推理为主,图像标记的贡献显着下降。最后,我们还对所产生的推理链的质量和信息充分性进行了全局和细粒度的分析。总的来说,我们的研究结果和分析为 LVLM 及其在研究和工业中的部署提供了实用的指导和见解。