论文

这是解码格式,而不是扰动:针对视觉语言测试时间缩放的基于一致性的审核选择

It's the Decoding Format, Not the Perturbation: Auditing Consistency-Based Selection for Vision-Language Test-Time Scaling

模型评测模型行为与机制分析

摘要

测试时间缩放通过对许多候选解决方案进行采样并在其中进行选择来提升 大语言模型 推理能力,但同样的方法在视觉语言模型 (VLM) 上的迁移效果很差:最近的工作表明,简单多数投票击败了基于模型自身自我验证的选择方法,显然是因为在选择层,基于图像的答案和来自先验语言的可信猜测看起来是相同的。一种自然的解决方法是使选择信号在没有图像的情况下无法计算。我们研究扰动一致性选择(Pgs),这是一种无标签的 无需训练 规则,通过模型是否在输入的标签保留扰动(裁剪、背景遮蔽、轻微光度或几何抖动)下重新推导每个候选者来评分;当扰动集为空时,Pgs 恢复多数投票。决定性的问题不在于 Pgs 是否仅击败多数投票的思想链,而在于一旦控制了解码格式和预算,扰动项是否会增加任何内容。因此,我们引入了格式匹配控件 (MatchedCtrl):在原始图像上花费相同的简短、无 CoT 绘制。在 TextVQA、MATH-Vision、MMMU 和 ViLP 中,在匹配预算选择器表中具有 Qwen 标题(三种子手段)和 LLaVA-OneVision 覆盖范围,Pgs 似乎在 TextVQA (Qwen) 上以 +31.8 分的优势击败了普通多数投票,但 MatchedCtrl 在每个基准测试(包括视觉所需的 ViLP)上都在噪声范围内跟踪或超过了 Pgs;没有 Qwen 类别显示出在此控制方面的显着优势。稳定性差距是真实的并且取决于图像(高达+0.48),但不能预测每个实例的胜利。结果是负面的和诊断性的:扰动一致性充其量只是视觉依赖性的部分诊断,并且一旦格式受到控制,其本身就不是可用的选择信号;针对仅 CoT 多数投票所报告的收益夸大了此类方法。