论文
GS-VLA:通过高斯分布对冻结的 VLA 策略进行即插即用视点规范化
GS-VLA: Plug-and-Play Viewpoint Canonicalization for Frozen VLA Policies via Gaussian Splatting
摘要
本文提出了一种轻量级、即插即用的框架,可以提高视觉-语言-行动(VLA)策略中观点转变的鲁棒性,而无需策略再训练。据我们所知,这是第一种直接利用基于 3D 高斯的新颖视图合成来实现 VLA 策略中的观察空间适应的方法。当前的 VLA 性能依赖于训练和部署相机配置相同的隐含假设。我们的实验表明,即使相机安装座发生很小的位移,也会将 LIBERO 基准测试的成功率从大约 90% 降低到最坏情况下的大约 10%。先前的方法,例如大规模 微调 或生成数据增强,计算成本昂贵,并且存在灾难性遗忘的风险。为了解决这个问题,观点转变被重新表述为局部新颖观点综合问题。在局部性假设下,相机扰动保持在相对于工作空间的小有界区域内,视点归一化简化为与场景和策略无关的去遮挡任务。我们的工作通过预置冻结 VLA 策略的 4M 参数 3D 高斯规范化器来实现这一想法。在不修改策略权重的情况下,GS-VLA 提高了三个正交轴的性能:(1) 策略架构,(2) 看不见的任务套件,以及 (3) 扰动尺度。这些结果表明,轻量级视觉模块可以恢复视点移动时损失的大部分性能,而无需策略重新训练。