论文
多语言 Visual MCQ 上小型 VLM 的测试时间缩放
Test-Time Scaling for Small VLMs on Multilingual Visual MCQ
摘要
测试时间缩放(TTS)可靠地改进了 大语言模型 中的推理,但它是否转移到小型开放视觉语言模型仍不清楚。我们在 EXAMS-V(一种多语言视觉多项选择基准)上对此进行了研究,比较了自我一致性、描述然后推理与 PRM 引导束搜索以及 Qwen2.5-VL-7B-Instruct 和 Qwen3.5-4B 中的两个事后选择器。重要的是 TTS 运行的条件,而不是搜索或验证机制。最大的因素是可解析性:早期的提示格式使许多链能够正确推理,但从未承诺回复信,而标准答案提示和引导修复步骤在很大程度上消除了这一点。更大的解码预算消除了其余部分:将每链词元限制从 1k 提高到 2k 可恢复 3.7 pp,而采样更多链(8 到 16)仅增加 0.15 pp。一旦链有完成空间,复杂的方法就几乎没有贡献:PRM 引导波束搜索以超过 8 倍的成本追踪简单的自一致性 0.39 pp,而且既不是 无需训练 生成评估器也不是训练有素的评估器多式联运 PRM 击败了两项政策的多数票。最大的收益来自政策模型本身(+11.4 个百分点)。我们的最佳配置在 ImageCLEF 2026 测试中达到 84.1%,在 Visual MCQ 排行榜上排名第一。