论文

统一视频动作联合去噪,实现灵巧动作和数据生成

Unified Video-Action Joint Denoising for Dexterous Action and Data Generation

模型训练监督微调与指令调优

摘要

最近的世界动作模型通过将广泛的视觉动态先验与可执行的机器人动作结合起来,利用视频基础模型。我们从分布的角度重新审视这种一致性。现有的表述通常将对齐的先验缩小为对未来行动的观察条件政策分布。相比之下,我们通过在多种调节机制下对交互视频和可执行手部轨迹的联合空间进行建模来保持更广泛的分布。我们提出了 Donk,一种针对灵巧手的统一视频动作去噪模型。通过语言、初始图像和初始手部状态,Donk 对未来视频和双手 MANO 轨迹进行采样,作为动作策略。在没有图像条件的情况下,相同的去噪架构会从文本条件分布中对成对的视频动作进行采样,将对齐的视频先验转换为数据引擎。在动作、视频和纯文本生成评估中,Donk 提高了灵巧的轨迹准确性,保持了强大的视频保真度,并在相同的统一训练方案下产生平滑的文本条件动作执行轨迹。