论文

DreamTraj:通过读取未渲染的视频扩散潜伏生成 6-DoF 对象轨迹

DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents

应用与实践视觉感知与空间理解

摘要

在操纵过程中准确预测物体轨迹对于闭合感知-动作循环至关重要。进展受到两个方面的限制:可用数据集缺乏细粒度的语言到运动注释,现有的预测器要么依赖视频、深度或 CAD 模型等特权输入,要么通过昂贵且容易出错的感知管道从完全生成的视频中恢复运动。我们使用 MOVE 数据集缩小了监督差距,该数据集有 5,038 个以对象为中心的自我中心轨迹,每个轨迹都配有细粒度的自然语言指令,而不是粗略的动词-名词标签。我们进一步提出了 DreamTraj,它从单个 RGB 图像和任务指令预测 6-DoF 对象轨迹,推理时不需要视频、深度或 CAD 模型:它不是生成视频,而是在早期去噪步骤中从冻结图像到视频扩散模型的内部表示读取运动。轻量级流匹配读取器将查询关键注意力轨迹解码并将隐藏状态池化为相对的 6-DoF 姿势。据我们所知,这是第一种直接从中间视频扩散表示而不是生成的像素解码对象 6-DoF 轨迹的方法。 DreamTraj 在翻译和旋转方面针对使用多帧或特权输入的预测器设定了新的技术水平,并且运行速度比生成然后提取管道快 4.6 倍。