论文
AeroManip-VLA:可扩展的视觉-语言-动作学习,用于空中操纵,并具有 RL 生成的演示
AeroManip-VLA: Scalable Vision-Language-Action Learning for Aerial Manipulation with RL-Generated Demonstrations
摘要
空中操纵器将机器人操纵扩展到地面机器人难以访问的 3D 工作空间,为通用操纵创造了新的机会。然而,由于操纵和飞行之间的紧密耦合、不断变化的观察结果以及安全关键的物理交互,将视觉-语言-动作(VLA)模型扩展到空中机器人会带来明显的挑战。这些挑战需要多样化的训练数据和系统的政策评估,但直接在物理空中平台上收集示范和评估政策成本高昂,难以扩展,并且在受控条件下难以重复。我们推出了 AeroManip-VLA,这是一个用于航空 VLA 数据生成和政策评估的可扩展基准。 AeroManip-VLA 提供了 GPU 加速的模拟框架,在大规模并行环境中具有低级有效负载感知飞行和操纵控制。在此框架的基础上,我们将可重用的强化学习策略与专家任务规则相结合,自动生成演示,而无需跨不同对象、环境和随机初始条件的人工远程操作。生成的数据包括抓取和放置等基本技能,以及需要导航和操作的长视野任务。我们进一步引入自动事件标记和轨迹分类来过滤演示。这些机制可以对任务进度、行为结果和安全相关故障进行细粒度分析。最后,我们评估了不同任务设置中的一系列模仿学习和 VLA 基线,揭示了它们的性能特征和故障模式。 AeroManip-VLA 共同支持在实际部署之前在模拟中进行可扩展的空中操纵数据生成、结构化轨迹分析和系统性 VLA 评估。