论文
FiberTune:在视觉-语言-动作中保留动作-Fiber 视觉残留 微调
FiberTune: Preserving Action-Fiber Visual Residuals in Vision-Language-Action Fine-Tuning
摘要
视觉-语言-动作(VLA)策略的动作监督 微调 有效地适合演示,但仅限制改变预测动作的方向,从而使视觉结构在动作等效状态之间保持一致,可以自由崩溃。我们将其形式化为沿着局部动作纤维的残余视觉崩溃,并提出了 FiberTune,这是一种训练时间目标,可以保留教师结构的视觉残差,而不增加推理时间开销。 FiberTune 使用在线动作探针来估计动作预测特征方向,从中间视觉标记表示中过滤它们,并将所得的探针过滤残差与冻结的视觉教师对齐,同时规范其有效秩。在相同的训练条件下,FiberTune 在跨越两个基准和两种架构(pi_0.5 和 OpenVLA-OFT)的六种受控模拟设置中的每一种以及物理 SO-101 拾取方面都比仅任务丢失的 微调 有所改进;代表性成果包括长期 CALVIN ABC-to-D 的 SR(5) +10.7 个百分点,以及物理 SO-101 任务成功率从 72.7% 上升至 78.1%。残留诊断表明,这些收益与增加的探针过滤残留教师对齐和有效秩相一致,与行动纤维动机一致。