论文

看看重要的是:可微分网格样本修剪用于可推广的视觉-语言-动作模型

See What Matters: Differentiable Grid Sample Pruning for Generalizable Vision-Language-Action Model

上下文与知识上下文工程

摘要

视觉-语言-动作(VLA)模型在机器人操作方面显示出了非凡的前景,但其高计算成本阻碍了实时部署。现有的词元修剪方法面临着一个根本性的权衡:使用修剪的积极压缩不可避免地会丢弃关键的几何细节,例如接触点,从而导致严重的性能下降。这迫使人们做出妥协,限制了可实现的压缩率,从而限制了潜在的加速。我们认为,打破这种权衡需要重新思考压缩作为视觉编码器中的几何感知、连续词元重采样。为此,我们提出了可微分网格采样器(GridS),这是一个即插即用模块,可以对 VLA 中的视觉标记执行任务感知、连续重采样。通过自适应地预测最小的显着坐标集并通过可微插值提取特征,GridS 保留了基本的空间信息,同时实现了大幅压缩(原始视觉标记少于 10%)。在 LIBERO 基准和真实机器人平台上进行的实验表明,通过验证迄今为止报告的最低可行视觉词元计数,GridS 实现了 FLOP 减少 76%,而成功率没有下降。该代码可在 https://github.com/Fediory/Grid-Sampler 获取。