论文
RoboAlign-R1:机器人视频世界模型的蒸馏多模态奖励对齐
RoboAlign-R1: Distilled Multimodal Reward Alignment for Robot Video World Models
摘要
现有的机器人视频世界模型通常是根据重建和感知相似性等低级目标进行训练的,这些目标与对机器人决策最重要的功能(包括指令遵循、操作成功和物理合理性)不太一致。它们还遭受长期自回归预测中误差累积的影响。我们提出了 RoboAlign-R1,这是一个将奖励对齐的 后训练 与机器人视频世界模型的稳定长视野推理相结合的框架。我们构建了 RobotWorldBench,这是从四个机器人数据源收集的 10,000 个带注释的视频指令对的基准,并训练多模式教师法官 RoboAlign-Judge,为生成的视频提供细粒度的六维评估。然后,我们将教师提炼为轻量级学生奖励模型,以实现基于高效强化学习的 后训练。为了减少长期采样轨迹漂移,我们进一步引入了滑动窗口重新编码(SWR),这是一种定期刷新生成上下文的 无需训练 推理策略。根据我们的域内评估协议,RoboAlign-R1 的六维总分比最强基线提高了 10.1%,其中操作精度提高了 7.5%,指令遵循提高了 4.6%;这些排名的提高得到了基于 VLM 的外部交叉检查和盲人研究的进一步支持。同时,SWR 提高了长视野预测质量,仅增加约 1% 的延迟,使 SSIM 提高 2.8%,LPIPS 降低 9.8%。总之,这些结果表明,奖励对齐的 后训练 和稳定的长视野解码提高了机器人视频世界模型中的任务一致性、物理真实性和长视野预测质量。