论文
DiffusionAnything:用于统一导航和预抓取运动的端到端上下文扩散学习
DiffusionAnything: End-to-End In-context Diffusion Learning for Unified Navigation and Pre-Grasp Motion
摘要
直接从视觉有效地预测运动计划仍然是机器人技术中的一个基本挑战,其中规划通常需要明确的目标规范和特定于任务的设计。最近的视觉-语言-动作(VLA)模型直接从视觉输入推断动作,但需要大量的计算资源、大量的训练数据,并且在新颖的场景中会出现零样本失败。我们提出了一种统一的图像空间扩散策略,通过多尺度特征调制处理米级导航和厘米级操纵,每个任务仅需要 5 分钟的自监督数据。三个关键创新驱动了该框架:(1)对任务模式、深度尺度和空间注意力的多尺度 FiLM 调节可以在单个模型中实现适合任务的行为; (2) 轨迹对齐深度预测侧重于沿着生成的路点进行度量 3D 推理; (3) AnyTraverse 的自我监督注意力可以实现目标导向推理,无需视觉语言模型和深度传感器。该模型纯粹通过 RGB 输入(2.0 GB 内存,10 Hz)进行操作,可实现对新颖场景的强大零样本泛化,同时仍然适合机载部署。