论文
RoboEvolve:用于有限数据的机器人操作的协同进化规划器模拟器
RoboEvolve: Co-Evolving Planner-Simulator for Robotic Manipulation with Limited Data
摘要
机器人操作的可扩展性从根本上受到任务相关物理交互数据稀缺的瓶颈。虽然视觉语言模型(VLM)和视频生成模型(VGM)有望实现自主数据合成,但它们分别遭受语义空间错位和物理幻觉的困扰。为了弥补这一差距,我们引入了 RoboEvolve,这是一种新颖的框架,它将 VLM 规划器和 VGM 模拟器耦合成一个相互增强的协同进化循环。 RoboEvolve 纯粹基于未标记的种子图像进行操作,利用了认知启发的双阶段机制:(i) 白天探索通过语义控制的多粒度奖励促进物理基础的行为发现,(ii) 夜间整合挖掘“险些发生”的故障以稳定策略优化。在自主渐进课程的指导下,该系统自然地从简单的原子操作扩展到复杂的任务。大量实验表明,RoboEvolve (I) 实现了卓越的有效性,将基地规划者提升了 30 个绝对点,并将模拟器的成功率平均提高了 48%; (II) 表现出极高的数据效率,仅用 500 个未标记的种子就超越了完全监督的基线——减少了 50 倍; (III) 展示了强大的持续学习能力,没有灾难性的遗忘。