论文
分块VLA模型的时频几何交叉注意力
Time-Frequency Geometric Cross-Attention for Chunked Vision-Language-Action Models
摘要
现代视觉-语言-动作(VLA)策略预测整个动作块:在一次前向传递中发出一到两秒的协调运动。然而,动作块本质上是一个短的多元轨迹,但在这些模型中,它是由线性头解码的通用每时间步隐藏标记的序列。这不足以满足两种运动结构的需要。首先,频率:一个块叠加了平滑的全局趋势和跨时间尺度的精细修正运动,并且单个Token将它们纠缠在一起。其次,跨阶段几何:不同阶段的运动(触及、接触、抓取调整、稳定)在表示空间中沿着非常不同的、接近正交的方向展开,但与任务紧密相关并在时间轴上出现。点积注意力通过内积对对齐进行评分,因此它有利于对齐标记,并且在正交性附近最不敏感,从而使网络可以通过绕道来恢复这种关系。我们引入了时频几何交叉注意(TFGCA),这是一个修复两个盲点的插入式模块。 TFGCA 使用每维可学习的固定小波变换将动作块分解为时频Token,每次Token通过交叉注意力从中检索信息,该交叉注意力通过可学习的权重将点积(相似性)与楔积幅度(对近正交性敏感)融合。零初始化残差会重现初始化时的基本行为,因此可以将其放入预训练的 VLA 上并联合进行微调。相对于同源基础,TFGCA 将分布内 LIBERO 平均提高了 +1.5,OOD LIBERO-Plus 提高了 +6.3,RoboTwin 域随机化下的随机平均值提高了 +28.5,三个真实机器人 AgiBot A2 任务的总体成功率提高了 +11.67 点,分布外增益更大。