论文
GeoHAT:用于移动操纵的几何自适应混合动作 Transformer
GeoHAT: Geometry-Adaptive Hybrid Action Transformer for Mobile Manipulation
摘要
全身移动操纵需要在视角变化的情况下协调移动底座和操纵器,这对几何感知和动作生成提出了挑战。当前的策略要么依赖于 2D 特征,要么依赖于缺乏密集空间结构的稀疏 3D 表示,并且通常将臂和基部编码在一个动作向量内,而忽略了它们独特的控制需求。此外,现有的密集融合策略可能会在噪声深度下破坏预训练的表示,同时产生大量的计算开销。我们提出了 GeoHAT,一个基于端到端扩散的框架,它建立在一个简单的原则上:几何结构应该只在可靠的地方注入,并且只在需要的地方进行处理。 GeoHAT 采用轻量级傅立叶空间编码器,可将密集的每像素 3D 坐标映射为几何标记,而无需额外的 3D 视觉主干。然后,通过深度有效性调制的每个词元门控融合,将这些词元选择性地注入视觉基础模型特征中,保留语义先验,同时丰富空间理解。对于动作生成,混合全身动作解码器将手臂和底座分解为不同的子空间,并让每个动作模态通过稀疏交叉注意力来通过注意力读取与任务相关的视觉上下文,而因果时间建模则捕获时间步内协调和时间步间依赖性。 ManiSkill-HAB 模拟基准测试表明,GeoHAT 的平均成功率达到 79.3%,比最强基线高出 23.7%。此外,针对不同任务的现实世界实验也证实了所有基线的一致改进。