论文

从被动视频到可编辑经验:面向具身智能的物理锚定经验合成

From Passive Video to Editable Experience: Physically Grounded Experience Synthesis for Embodied Intelligence

模型训练合成数据

摘要

具身AI的关键瓶颈不在于模型架构,而在于数据。尽管网上存在数十亿条人类操作视频,但由于人类形态与机器人硬件之间的具身差距,机器人无法直接从中学习。我们提出Pegasus,一个通过结构化知识迁移将人类演示转化为机器人可学习数据的低资源框架。Pegasus不依赖原始视频提示,而是构建基于图的中间表示:从人类视频中提取的Task Graph经由Affordance与Constraint Graphs转换为Robot Planning Graph,用于机器人条件化的视频生成。分层可供性潜在空间对物体状态、可供性与任务之间的关系建模,实现超越物体身份的泛化。闭环物理验证器进一步利用运动学可行性、碰撞约束和关节极限过滤无效的生成结果。我们在包括GTEA Gaze+和EPIC-KITCHENS-100在内的一系列自我中心操作基准以及多种机器人具身上评估Pegasus,考察Task Correctness、Executability、State Consistency和Learnability。结果证明了可靠的跨具身转换,并表明机器人数据生成可以从硬件采集问题重构为可扩展、低资源的知识迁移问题。

从被动视频到可编辑经验:面向具身智能的物理接地经验合成:论文配图
图 1:Pegasus 架构。人类演示被转化为任务图,在分层可供性潜在空间中编码,转化为特定于实施例的机器人规划图,根据物理约束进行验证,并呈现为机器人学习体验。