论文

多样性很重要:重新审视视觉语言模型中的测试时计算

Diversity Matters: Revisiting Test-Time Compute in Vision-Language Models

模型推理测试时计算扩展

摘要

测试时计算 (TTC) 策略已成为一种轻量级方法,可增强 大语言模型 (LLM) 的推理能力。然而,它们在视觉语言模型 (VLM) 中的应用和优势仍未得到充分探索。我们提出了跨七个 VLM 和六个基准的 TTC 系统研究,特别分析了基于特征的评分和多数投票方法。我们发现,特征启发式方法失败了,投票在单一模型设置中仅产生了适度的收益。我们从理论上表明,这种限制源于缺乏预测多样性:当输出高度相关时,投票几乎没有带来什么好处。相比之下,多模型集成提供了更丰富的多样性,但标准多数投票未能考虑到不同的模型功能。为了解决这个问题,我们提出了基于熵的 TTC (ETTC),它根据预测熵选择最可信的预测。我们的方法在单模型情况下简化为多数投票,但在模型集成中,它利用置信度差异来优先考虑更强的模型。我们证明 ETTC 在温和假设下优于多数投票,并凭经验证明它始终优于投票和最佳个体模型。至关重要的是,我们的结果表明,较小的模型可以协同增强较大的模型,从而释放标准策略无法实现的集成收益。