论文

Action QFormer:视觉语言动作模型中动作监督下的结构化表示塑形

Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models

模型架构新型架构

摘要

视觉语言动作(VLA)模型中的动作监督常被视为学习动作预测的下流目标。本文转而把它研究为塑造继承多模态表示的力量。我们显示这种塑造有双重效应:它是形成动作兼容表示所必需的,但当动作监督被过直锚定施加于继承的多模态通路时,也会破坏支持语言侧处理与物体落地的表示。为解决该张力,我们引入Action QFormer:一个面向动作的查询式接口——用指令条件化的查询把继承的多模态信息重组为面向动作的表示,再交给下游动作生成。在零样本仿真到真实导航中:Action QFormer把平均闭环任务成功率从18.8%提升到56.3%,把固定指令动作生成正确率从22.5%提升到75.5%,并几乎消除分布外指令生成。进一步分析显示:Action QFormer改变动作监督塑造继承多模态表示的方式——减少大范围的上游改写,同时保留定向的、有时是建设性的动作监督适配。结果表明改进VLA不仅需要更强的预训练骨干,还需要更好的方式来选择与组织继承的多模态信息、并控制它在动作监督下如何被塑造。

Action QFormer:视觉语言动作模型中动作监督下的结构化表示塑形:论文配图
图 9:Action QFormer 减少了上游令牌重写,同时保留了有针对性的适应(第 V-B 节)。所有面板都比较面板 (a) 中所示的相同的六个渐变设置。 (a) 控制/空间令牌视图测量与动作更新阻止参考的令牌级余弦距离;值越高表示目标令牌修改越强。基线广泛地重写了与控制相关的标记组,而 Action QFormer 将适应集中在更具选择性的关键标记子集上,包括方向和运动标记,例如向左、向右、转动、绕行和停止。 (b) 重写幅度,通过令牌漂移能量测量,表明直接融合基线经历了更大规模的令牌重写,而 Action QFormer 降低了重写的总体幅度。 (c) 重写扩展,通过活动维度分数来衡量,捕获重写在每个标记内的隐藏维度上扩展的范围。