论文

压缩差距:为什么离散标记化限制视觉-语言-动作模型扩展

The Compression Gap: Why Discrete Tokenization Limits Vision-Language-Action Model Scaling

模型评测模型行为与机制分析

摘要

通过升级视觉编码器来扩展视觉-语言-动作 (VLA) 模型有望提高下游操作性能,就像在视觉语言建模中一样。我们证明,当动作被表示为离散标记时,这种期望会失败,并解释了为什么通过我们称为压缩间隙的信息理论原理:在任何视觉运动管道中,缩放行为由最紧密的信息瓶颈的位置控制。当动作连续时(例如扩散策略),视觉编码器是绑定约束,升级它可以直接提高性能。当动作通过固定容量的码本(例如,OAT)离散化时,码本成为绑定约束,编码器的改进无法传播过去——无论上游表示有多么丰富。我们通过三方面证据在 LIBERO 基准上验证了这一原理:阶乘实验表明,编码器升级将扩散策略提高了 21 个百分点以上,而 OAT 收益在模型规模上大幅衰减;四个编码器之间的编码器质量梯度,确认扩散策略单调跟踪编码器质量,而 OAT 保持平坦;码本大小实验证明,放宽码本容量可以部分恢复编码器灵敏度,为瓶颈假设提供因果证据。我们的研究结果表明,物理人工智能的扩展需要确定管道中信息瓶颈所在,而不是统一增加模型或数据大小。