论文
GRPO-TTA:通过 GRPO 驱动的强化学习对视觉语言模型进行测试时视觉调整
GRPO-TTA: Test-Time Visual Tuning for Vision-Language Models via GRPO-Driven Reinforcement Learning
摘要
组相对策略优化 (GRPO) 最近在 后训练 大语言模型 和视觉语言模型中表现出强劲的性能。这就提出了一个问题:GRPO 是否也显着促进了视觉语言模型的测试时间适应(TTA)。在本文中,我们提出了测试时间适应的组相对策略优化(GRPO-TTA),它通过将特定于类别的提示预测重新表述为组策略优化问题,使 GRPO 适应 TTA 设置。具体来说,我们通过从 CLIP 相似性分布中采样前 K 类候选来构建输出组,从而实现概率驱动的优化,而无需访问 真值 标签。此外,我们设计了针对测试时间适应的奖励函数,包括对齐奖励和分散奖励,以指导有效的视觉编码器调整。跨不同基准的大量实验表明,GRPO-TTA 始终优于现有的测试时间适应方法,在自然分布变化下具有显着更大的性能增益。