论文

闭环崩溃剖析:压缩 VLA 策略的因果案例研究

Anatomy of a Closed-Loop Collapse: A Causal Case Study of a Compressed VLA Policy

模型评测模型行为与机制分析

摘要

压缩操纵策略可以通过离线评估,但闭环执行失败;这种分离是在之前的工作中建立的,并不是我们的主张。我们对一个自然发生的案例进行了因果剖析。 Octo-Base 的 8 层蒸馏保留了 86% 的参数,通过了我们应用的每一次离线检查(家庭自己的验证指标的教师比率为 0.996 和 1.000),并在闭环中崩溃:在模拟 WidowX 拾放任务中,0/72 与教师的 40/72。崩溃是结构化的,而不是分散的:早期任务阶段逐渐退化(学生移动物体的速度是老师的 90%,抓握速度是 55%),而运输到目标的速度明显失败,在每个训练变体中都是 0%。配对的动作追踪取证隔离了签名:负的、后期重的 $z$ 残差,大约是修复后大小的 10 倍,并且在基础蒸馏和两个延续分支中持续存在。四种标准疗法在匹配对照下失败:持续训练和域内离线数据使成功率为零,尽管后者可显着改善边际行动统计数据;尽管同样的扰动会降低健康的政策,但指挥层的补偿在任何情况下都无法恢复;将症状限制在命令通道中可以保留抓握力,但成功仍停留在地板上。最小配对干预用部署-分布教师部署替代一半的训练流,其他设置保持固定,恢复与教师的平等(18/36 与 17/36 保留),消除该签名,并恢复类似教师的扰动响应配置文件。我们主张存在,而不是普遍性。从操作上来说,离线门控(包括家庭自己的验证指标)不足以对压缩策略进行验收测试;几十次闭环试验足以找到他们错过的东西。