论文
接线问题:视觉-语言-动作策略中可供性头的注入拓扑和初始化
Wiring Matters: Injection Topology and Initialization of Affordance Heads in Vision-Language-Action Policies
摘要
密集的可供性监督对于视觉-语言-动作 (VLA) 策略来说是一个有吸引力的辅助信号,但天真地与训练配合可供性头部可能会严重损害指令遵循。我们提出了一项对照研究,探讨如何将这样的头部连接到 LIBERO 基准上的现代VLA中。我们的配方通过 stop-梯度读取骨干模型,并通过学习桥将中间头部特征重新注入到动作专家中。停止梯度是一个先决条件:让梯度达到骨干模型的可见性会将策略降低到无头基础以下(85.5% vs. 93.1%)。在骨干模型受到保护的情况下,相同预算的 2*2 消融过注入拓扑(串联与残差)和桥初始化(零与随机)表明初始化是主导杠杆。最好的接线,即主动初始化的残余桥,达到 96.2%,与更精细的三专家 AffordanceVLA (95.8%) 相匹配,但额外的参数不足 1%。两个探针解释了该机制:作为输入伤害的地面实况可供性,推理时归零显示惰性桥仅充当训练时间正则器,而主动桥则成为承载。
