论文

用于体现控制的动作和语言条件视频评估

Action- and Language-Conditioned Video Assessment for Embodied Control

模型训练奖励建模与过程监督

摘要

执行多步自然语言指令的基于视觉的实体代理需要反馈机制来评估完整轨迹上的任务进度。基于最终帧匹配或连续嵌入相似性的传统方法可能会忽略确定指令是否已完成所必需的中间转换。我们提出了 ALVA(动作和语言条件视频评估),这是一种轨迹评估器,其评估以视觉观察、执行的动作序列和自然语言指令为条件。该方法分两个阶段使用预先训练的视觉语言模型(VLM):首先总结以执行动作为条件的帧到帧视觉转换,然后评估相对于指令生成的摘要,以产生离散的轨迹级进度分数。在模拟 3D 家庭环境中,ALVA 表现出保守的评估模式,误报率接近于零。当用作闭环策略优化的终端反馈时,它比评估的静态图像和基于嵌入的视觉基线提供更有效的反馈,并缩小了与 真值 预言机的性能差距。这些结果支持以动作和语言为条件的视频评估作为评估的模拟体现控制任务的可解释反馈机制。