论文
超越重构错误:自回归视觉语言动作模型的分析和数据驱动的动作标记化
Beyond Reconstruction Error: Analytical and Data-Driven Action Tokenization for Autoregressive Vision-Language-Action Models
摘要
离散动作标记化是自回归视觉语言动作(VLA)模型的核心,但动作表示通常主要通过重建保真度来评估。通过比较统一标记化接口下的固定分析、数据驱动的线性和非线性神经表示,我们询问哪些表示属性对于闭环控制实际上很重要。在率失真分析、序列建模诊断和 3,500 次 LIBERO 推广中,代表性排名随评估标准而变化。 PCA 实现了比 Temporal-DCT 更低的名义重建误差,但产生的标记序列的可预测性较差,并且三个策略训练种子的平均可见任务成功率降低了 3.0 个百分点,其中一个种子中的策略顺序相反。在匹配的 Seed-42 消融中,自动编码器进一步减少了重建误差,但不会产生最强的策略,并且对离散词元扰动表现出更高的敏感性。这些发现表明,仅重建保真度无法可靠地选择自回归控制的动作表示,从而激发了对几何保真度、序列可预测性、解码器稳定性和闭环性能的联合评估。