论文

架构采样:通过冻结视觉语言模型中的计算多样性来缩放测试时间

Architectural Sampling: Test-Time Scaling via Computational Diversity in Frozen Vision-Language Models

模型推理测试时计算扩展

摘要

测试时计算扩展通常通过对冻结模型的多个响应进行采样来寻求更好的答案,而传统的温度采样会沿着相同的固定计算路径生成每个候选值。我们引入了架构采样,这是一种无需训练的方法,通过重用选定的解码器层块,通过不同的前向计算来生成候选者。改变块位置和重复计数会引入计算多样性,而无需更新模型权重或添加辅助参数。在 5 个 Qwen 检查点和 12 个多模态基准测试中,在相同的 9 个候选预算下,架构采样比标准路径温度采样平均将 pass@9 提高了 6.58 个百分点。重用早期层会产生最强的收益,并且即使在贪婪解码下,候选覆盖率的提高仍然持续存在。当用作无标签测试时强化学习的rollout时,生成的候选结果显示出较低的词汇重叠并提高了准确性。这些发现将我们的架构采样的优势扩展到了候选覆盖范围之外,证明了从模型自身输出中进行更有效的学习。