论文

AeroAct:用于语言条件四旋翼飞行的以动作为中心的世界动作模型

AeroAct: Action-Centered World-Action Models for Language-Conditioned Quadrotor Flight

摘要

语言条件四旋翼飞行需要一种策略来实现语义目标,预测自我运动的视觉后果,并输出在快速变化的第一人称视图下保持平滑和动态可执行的控制参考。现有的航空视觉语言导航和视觉语言动作方法通常使用离散动作、高级航路点或瞬时速度命令,这些方法对飞行动作如何改变未来观测提供有限的监督。我们推出了 AeroAct,一种用于四旋翼导航的以动作为中心的世界动作模型 (WAM)。据我们所知,AeroAct 是第一个针对现实世界空中飞行实例化和演示的 WAM。该模型采用预训练的视频扩散 Transformer 来根据以自我为中心的视觉历史、本体感觉和语言来预测局部轨迹动作块。未来的第一人称帧在训练期间用作密集的结果监督,而部署则直接解码动作而不生成未来的视频。为了获得对齐的视觉、状态、语言和动态可行的动作数据,我们构建了一个基于 DiffAero 的管道,并配有互补的 Isaac Lab 和 3D 高斯泼溅渲染器。我们进一步介绍了一种低成本手持式收集设备,它将相机观察与运动估计结合起来,以重新创建类似飞行的自我中心轨迹,以及提高重叠轨迹块之间的时间一致性的自引导程序。闭环仿真和现实世界实验表明,时间视觉上下文可提高目标跟踪和对象搜索性能,并且基于 WAM 的策略可以在物理四旋翼飞行器上执行。