论文

先排序后行动:从帧顺序进度中进行无奖励控制

Rank-Then-Act: Reward-Free Control from Frame-Order Progress

模型训练奖励建模与过程监督

摘要

我们引入了 Rank-Then-Act (RTA),这是一个从专家视频演示中学习控制策略的框架,无需环境奖励。 RTA 在打乱的帧序列上使用组相对策略优化 (GRPO) 目标,离线训练视觉语言模型 (VLM) 作为基于进度的序数评分器,这迫使模型从视觉语义而不是琐碎的时间线索中恢复时间顺序。重要的是,我们没有直接使用评分器作为标量奖励模型,而是提出了一种基于相关性的强化学习奖励函数:在每个交互窗口,我们计算预测进度排名和真实时间指数之间的斯皮尔曼排名相关性,产生有界的、尺度不变的学习信号。这种设计将奖励学习与绝对校准分离,并实现跨任务和环境的稳定传输。我们在离散控制基准(PyBoy:Catrap、Kirby)和连续控制任务(PointMaze、MetaWorld)上评估 RTA。 RTA 始终匹配或优于先前基于视频的奖励学习方法和基于排名的基线,同时展示了单个预训练进度评分器的强大跨任务重用性。我们的结果表明,对视频衍生序数信号的相关结构监督足以进行策略学习,为显式奖励设计提供了可扩展的替代方案。