论文
利用图像问题依赖性实现更好的 VLM 测试时强化学习
Harnessing Image Question Dependence for Better VLM Test-time Reinforcement Learning
摘要
测试时强化学习可以使视觉语言模型(VLM)适应未标记的目标数据,但其有效性从根本上受到自生成学习信号的可靠性的限制。为了评估基于共识的学习信号的可靠性,我们分析了跨不同 VQA 数据集和模型大小的 VLM 测试时强化学习,揭示了两个局限性。首先,基于共识的测试训练的收益主要来自答案标准化而不是内容修正。其次,由于模型联合使用图像和问题的能力有限,许多初始 VLM 响应都是不正确的;从这些输出中获得的共识奖励可能会保留由此产生的基础错误,而不是纠正它们。受这些启发,我们提出了 TTIQ,这是一种测试时强化学习框架,它利用图像-问题依赖性来实现更好的 vlm 适应。 TTIQ 教师在原始图像-问题对及其图像和问题消融变体下强制每个采样响应,使用生成的标记级似然变化来估计对每个输入的依赖性。它将图像和问题依赖性与校准的置信度结合起来,构建有利于同时得到图像和问题支持的回答的响应级别奖励,并使用词元级别信号为两种输入支持的词元分配更大的正向策略贡献。这种设计有利于基于图像和问题且足够自信的回答,而不仅仅是流行的回答。跨八个 VQA 数据集和多个 VLM 大小的实验表明,TTIQ 在每个模型规模上都实现了最佳平均性能。它进一步推广了 VLM 系列,而在一个数据集上训练的模型无需进一步训练即可提高在未见过的数据集上的性能。