论文
SC3-Eval:通过自洽视频生成评估机器人基础模型
SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation
摘要
评估现实世界中的通用机器人操纵政策是昂贵、缓慢且难以扩展的。动作条件视频世界模型通过模拟策略执行轨迹提供了可扩展的替代方案。自回归轨迹生成会累积复合误差,多个摄像机视图的观察结果必须保持相互一致,评估者必须推广到其行为超出训练分布的策略。我们使用 SC3-Eval 来应对这些挑战,这是一种自洽的视频生成方法,通过强制执行三种互补形式的一致性,将预先训练的视频基础模型调整为准确的策略评估器。首先,前向-逆向动力学一致性联合训练模型从动作中预测帧并从帧中恢复动作,将生成的轨迹锚定到物理上合理的动作流形,并抵消仅前向模型无法惩罚的漂移。其次,跨视图一致性训练模型修复每个摄像机视图与另一个摄像机视图,从而在长时间轨迹生成中保持多摄像机观察的连贯性,而无需任何显式记忆机制。第三,测试时一致性在推理时重用逆动态模式作为每个动作块的不确定性信号,该信号终止生成的帧偏离所请求的动作的执行轨迹。我们还演示了 SC3-Eval 的执行轨迹重现了策略在真实环境执行轨迹中的故障模式,支持细粒度的诊断比较,而不是单独的聚合排名。在七个现实世界的视觉-语言-行动策略中,SC3-Eval 获得了 0.929的闭环 Pearson 相关性和 0.119的 MMRV,优于之前三个基于视频模型的强大基线,并推广到新任务。