论文
动作代理:代理视频生成遇到流量约束扩散
Action Agent: Agentic Video Generation Meets Flow-Constrained Diffusion
摘要
我们提出了 Action Agent,这是一个两阶段框架,它将代理导航视频生成与流约束扩散控制相结合,用于多实施例机器人导航。在第一阶段,大语言模型(LLM)充当编排模块,选择视频扩散模型,通过迭代验证细化提示,并积累跨任务内存以从语言和图像输入合成物理上合理的第一人称导航视频。这将 50 个导航任务中的视频生成成功率从 35%(单次)提高到 86%。在第二阶段,我们引入了 FlowDiT,一种流约束扩散 Transformer,它使用动作空间去噪扩散将优化的目标视频和语言指令转换为连续速度命令。 FlowDiT 集成了 DINOv2 视觉特征、用于自我运动表示的学习光流以及用于语义停止的 CLIP 语言嵌入。我们对 RECON 户外导航数据集进行预训练,并对 Isaac Sim 中收集的 203 个 Unitree G1 人形数据集进行微调,以校准速度动力学。单个 43M 参数检查点在开环执行下,在不可见的室内环境中,在模拟中实现了 73.2% 的导航成功率,在真实的 Unitree G1 上实现了 64.7% 的任务完成率,同时运行频率为 40--47 Hz。我们通过三个实施例评估 Action Agent:Unitree G1 人形机器人(真实硬件)、无人机和轮式移动机器人 (Isaac Sim),证明将轨迹想象与执行分离可以产生可扩展且可感知实施例的语言引导导航范例。