论文
输出级正则化消除了单 GPU VLA 微调 中的种子抽签
Output-Level Regularization Eliminates the Seed Lottery in Single-GPU VLA Fine-Tuning
摘要
微调 单 GPU 上的视觉语言动作模型 (VLA-JEPA) 应该很简单:加载预训练的检查点、运行训练、部署。存在隐患。运行相同的 微调 代码十三次——相同的数据、相同的架构、不同的随机种子——十二次运行产生的机器人在 91--94% 的时间内成功,而一次运行则默默地降级到 65.2%:29 pp 的差距,没有错误消息,没有警告,也无法预测哪个种子将失败。我们称之为种子彩票。我们追踪输出崩溃的原因:无论机器人看到什么,动作预测器都会悄悄地学习产生几乎相同的输出。现有的权重级别方法(L2、EWC)在结构上对这种崩溃视而不见——它们惩罚权重变化,但崩溃发生在权重可以自由移动而不影响输出的方向上,这是我们通过雅可比零空间形式化的间隙。跨 7 种方法 x 最多 13 个种子 x 3 个 LIBERO 基准,三个输出级正则化器——VICReg(n=12 个种子)、Dropout(n=4)和减半学习率(n=5)——每个都消除了每个灾难性种子(0/21 组合崩溃与 1/13 基线;F(12,11)=28.7,p<0.001),而权重级别方法(L2,EWC)保存彩票。最简单的修复方法是更改优化器配置中的一个数字。