论文
RobotAPO:面向机器人操作视频的对抗物理偏好优化
RobotAPO: Adversarial Physics Preference Optimization for Robotic Manipulation Video Generation
摘要
机器人操作视频越来越多地用作实体Agent的视觉计划,但纯粹针对视觉合理性进行优化通常无法捕捉现实世界交互中脆弱的物理多样性。即使交互边界处存在轻微的违反物理的错误,例如相互渗透或过早的物体运动,也可能完全使下游执行所需的推断时间和姿势无效。由于标准监督微调缺乏惩罚这些局部故障的直接压力,因此我们引入了 AgiBot-PhysPref。这个经过严格管理的 10,000 个样本偏好数据集隔离了条件匹配的物理违规,将发电机自身的故障分布转变为物理一致性的基础信号。在此基础上,我们提出了 RobotAPO,一种在连续流匹配去噪空间中运行的对抗性物理偏好优化框架。为了防止策略仅仅记住静态策划的失败,RobotAPO 采用了一个轻量级的对抗性反事实提议者,它学习依赖于条件的、 去噪空间中的物理故障偏向方向。这鼓励模型探索并更好地尊重物理交互边界,同时保持纯粹的提示和参考推理界面,而不需要外部结构条件。综合评估表明,明确纠正这些局部物理违规可以改善生成视频的下游机器人执行情况。在保持 AgiBot 条件下,RobotAPO 在物理一致性方面的表现优于最强的受控内部基线,硬分数为 6.8%,软分数为 10.0%。至关重要的是,在真实的机器人重放中,它将这些物理一致性收益转化为任务成功率相对于最强受控内部基线提高了 37.4%。