论文
SPOT-E:针对冻结 VLM 的视觉聚光灯测试时熵整形
SPOT-E: Test-Time Entropy Shaping with Visual Spotlights for Frozen VLMs
摘要
视觉语言模型(VLM)通常在证据密集型任务中表现不佳,因为决定性的视觉证据很小、局部化且容易被忽视,即使高级推理完好无损,也会导致证据读出失败。先前的推理时间视觉干预可以在无需重新训练的情况下改善视觉证据利用,但它们在很大程度上是开环的,并且缺乏验证突出证据是否实际使用的机制。我们研究答案跨度预测熵作为模型内部反馈信号,并表明朴素熵最小化是不明确的,因为低熵可能来自基于证据的置信度或捷径崩溃。为了解决这种歧义,我们引入了低熵锚和熵整形目标,可以减少答案的不确定性,同时保留基线高置信度标记。我们在 SPOT-E 中实例化了这一原理,这是一种即插即用的测试时间方法,可生成问题条件聚光灯,并通过基于组相对策略优化 (GRPO) 的轻量级调整对每个实例进行优化。在所有基准测试和不同的 VLM 系列中,SPOT-E 都能产生一致的增益并提高视觉损坏情况下的鲁棒性。代码公开于:https://github.com/YinBo0927/SPOT-E