论文
ActionMap:通过体素动作热图学习机器人策略
ActionMap: Robot Policy Learning via Voxel Action Heatmap
摘要
视觉-语言-动作 (VLA) 模型在主干网、训练方法和数据规模方面取得了快速进展,但将主干网的隐藏状态转换为连续控制信号的动作解码器几乎没有变化,并且仍然是当前大多数 VLA 中的单点预测器。无论是通过自回归词元箱、L1 回归还是流匹配去噪来实现,生成的解码器都会将动作空间视为非结构化,从而在训练期间不会利用相邻动作的几何接近度。为了推进这一点,我们引入了 ActionMap,这是一个体素热图动作头,可放入现有的 VLA 中代替其本机动作解码器。对于每个新动作,头部会预测动作空间上的体素热图,其中每个体素直接存储相应动作的概率。在 LIBERO 模拟和现实世界的 Franka 操作中,我们的热图头在匹配的训练步骤中超越了两个架构上不同的主干(例如,在 LIBERO 四组平均值上比 OpenVLA-OFT 的 L1 回归头高出 8.2%),在两个主干上以相当或更快的速率收敛,并且在低训练数据下保持明显更高的数据效率。跨主干网一致性表明,动作表示是 VLA 性能的真正杠杆,与进一步的主干网或配方扩展不同。项目页面:https://showlab.github.io/ActionMap/。