论文

HaPRL:视觉搜索Agent的人类锚定过程强化学习

HaPRL: Human-Anchored Process Reinforcement Learning for Visual Search Agent

模型训练奖励建模与过程监督

摘要

多轮视觉搜索Agent通过迭代地决定查看位置来回答有关高分辨率图像的问题。这些Agent的强化学习仅奖励最终答案,使搜索过程不受监督。因此,推理过程错误但最终结果正确的错误路线经常出现,进而导致无效的训练,即沿着错误的路径进行扩展。在本文中,我们介绍了 HaPRL,这是第一个利用人类搜索行为强化搜索过程的框架。我们首先构建一个标注平台,并收集 1K+ 具有细粒度行为信号的人工标注数据。在训练过程中,精心设计的评判员会根据任务自适应权重对每次展示进行评分,并以人类注释者实际搜索同一图像的方式进行提炼。大量实验表明,HaPRL 始终优于基于结果的 RL,并且早期过程监督在后续基于结果的扩展中产生了 6.7 倍的改进。我们的结果还证明了将模型行为与人类过程注释信号保持一致的重要性,这为基础模型的训练提供了新的见解。