论文

通过结构感知微调增强VLM奖励模型

Enhancing VLM Reward Models Through Structure-Aware Fine-Tuning

模型训练奖励建模与过程监督

摘要

设计有效的奖励函数仍然是强化学习(RL)的主要瓶颈。最近的工作使用大型基础视觉语言模型(VLM)作为奖励模型,计算文本观察相似度以绕过手动奖励工程。尽管前景光明,但这些奖励通常是嘈杂且不可靠的,限制了它们在部署期间的直接效用。我们提出了结构感知 微调 (SAFT),这是一种简单的自监督方法,可以在线改进这些不完美的奖励信号,而无需访问 真值 监督。 SAFT 利用内在结构先验通过 LoRA 适配器规范 VLM 的潜在空间。我们严格评估 SAFT 的一系列基本模型功能,以证明其多功能性。我们的结果表明,SAFT 始终如一地对奖励景观进行去噪,从而产生更快的策略收敛,并相对于底层基础模型显着改善对齐(EPIC 距离),这表明失败通常可归因于结构脆性而不是语义误解。通过用任务固有的结构性归纳偏差取代广泛的人类偏好注释,SAFT 提供了一种稳定文本条件 RL 的可扩展路径,并强调了将任务结构合并为一般归纳偏差的更广泛价值。