论文

接线问题:视觉-语言-动作策略中可供性头的注入拓扑和初始化

Wiring Matters: Injection Topology and Initialization of Affordance Heads in Vision-Language-Action Policies

模型训练参数高效训练

摘要

密集的可供性监督对于视觉-语言-动作 (VLA) 策略来说是一个有吸引力的辅助信号,但天真地与训练配合可供性头部可能会严重损害指令遵循。我们提出了一项对照研究,探讨如何将这样的头部连接到 LIBERO 基准上的现代VLA中。我们的配方通过 stop-梯度读取骨干模型,并通过学习桥将中间头部特征重新注入到动作专家中。停止梯度是一个先决条件:让梯度达到骨干模型的可见性会将策略降低到无头基础以下(85.5% vs. 93.1%)。在骨干模型受到保护的情况下,相同预算的 2*2 消融过注入拓扑(串联与残差)和桥初始化(零与随机)表明初始化是主导杠杆。最好的接线,即主动初始化的残余桥,达到 96.2%,与更精细的三专家 AffordanceVLA (95.8%) 相匹配,但额外的参数不足 1%。两个探针解释了该机制:作为输入伤害的地面实况可供性,推理时归零显示惰性桥仅充当训练时间正则器,而主动桥则成为承载。

接线问题:视觉-语言-动作策略中可供性头的注入拓扑和初始化的原论文方法或结果图
图 1:左:我们的配方(Res-Active)。 骨干模型在一次前向传递中对摄像机视图和指令进行编码;每层投影 $W^{\mathrm{proj}}_{l}$ 将每层的视觉token $v$ 传递给流程匹配动作专家的相应层。可供性头通过停止梯度水龙头读取均匀间隔的骨干模型层,将早期层重新组装到更精细的网格上,将后面的层重新组装到更粗糙的网格上,通过级联 $F_{0},\dots,F_{M}$ 将它们融合,并解码由 $\mathcal{L}_{\mathrm{aff}}$ 监督的每个视图接触热图。中间融合阶段 $F_{k}$ 的特征 $r$ 由桥 $W^{\mathrm{proj}}_{\mathrm{aff}}$(在文本中写为 $W_{\mathrm{aff}}$)返回到每个调节层的视觉token中。专家一次性接受行动目标 $\mathcal{L}_{\mathrm{act}}$ 的训练;在推理时,它整合了几次传递中学到的流程。右:我们的 $2{\times}2$ 消融的四个桥接线,从上到下 Cat-Lazy、Res-Lazy、Cat-Active 和 Res-Active(我们的)。蓝色表示零初始化(惰性)桥,红色表示随机初始化(活动)桥;连接相邻 $v$ 和 $r$ 框的 $\oplus$ 表示共享投影之前的串联,而token流上的 $\oplus$ 表示将投影的 $r$ 按元素添加到未触及的 $v$ 上。