论文

NAC:视觉-语言-动作模型的神经动作编解码器

NAC: Neural Action Codec for Vision-Language-Action Models

模型架构新型架构

摘要

视觉-语言-动作 (VLA) 模型依赖离散动作标记器来桥接连续机器人控制和自回归序列建模,但现有标记器通常在压缩、延迟和下游性能之间进行权衡。我们通过神经音频编解码器(具有残差矢量量化的卷积编码器-解码器架构,作为音频基础模型的标准前端)的视角重新审视这一设计。受其成功的激励,我们引入了神经动作编解码器 (NAC),它将短机器人动作轨迹视为多通道 1D 信号,并使用多尺度 RVQGAN 架构对其进行压缩。通过适应动作表示、压缩率和重建目标,音频编解码器样式模型可以以高保真度自动编码动作,而无需进行大量架构更改。 NAC 通过偏移码本提供紧凑、有序的词元空间,使标准自回归策略能够在短的结构化序列上运行。与此同时,带有 ISTFT 头和对抗性鉴别器的 Vocos 式解码器可以恢复动作轨迹。在 LIBERO-10、RoboMimic 和一系列现实世界的操作任务中,NAC 与 binning、FAST 和之前基于 VQ 的分词器相比,在相当或更好的压缩率下实现了高重建保真度和更高的平均成功率。这些结果表明,重新调整用途的神经音频编解码器为现代 VLA 中的学习动作标记化提供了强大、实用的支柱。