论文

AttenA+:纠正机器人基础模型中的动作不平等

AttenA+: Rectifying Action Inequality in Robotic Foundation Models

模型训练监督微调与指令调优

摘要

现有的机器人基础模型虽然强大,但基于时间同质性的隐含假设:在优化过程中将所有动作视为同等信息。这种从语言建模继承而来的“扁平”训练范式仍然对底层的物理操作层次结构漠不关心。事实上,机器人轨迹从根本上来说是异构的,其中低速部分通常通过精度要求较高的交互来决定任务的成功,而高速运动则充当容错过渡。统一损失权重和物理关键性之间的这种不一致从根本上限制了当前视觉-语言-行动(VLA)模型和世界行动模型(WAM)在复杂、长期任务中的性能。为了纠正这个问题,我们引入了 AttenA+,这是一个与架构无关的框架,它通过速度驱动的动作注意力来优先考虑运动学关键部分。通过根据逆速度场重新调整训练目标的权重,AttenA+ 自然地将模型的学习能力与操作的物理需求结合起来。作为即插即用的增强功能,AttenA+ 可以集成到现有主干中,无需进行结构修改或附加参数。大量实验表明,AttenA+ 显着提高了当前最先进模型的上限。具体来说,它将 Libero 基准上的 OpenVLA-OFT 提高到 98.6%(+1.5%),并将 RoboTwin 2.0 上的 FastWAM 提高到 92.4%(+0.6%)。 Franka 机械臂的真实世界验证进一步展示了其稳健性和跨任务泛化能力。我们的工作表明,挖掘动作序列的内在结构先验为标准缩放定律提供了高效、物理感知的补充,为通用机器人控制铺平了一条新道路。