论文
Action QFormer:视觉语言动作模型中动作监督下的结构化表示塑形
Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models
摘要
视觉语言动作(VLA)模型中的动作监督常被视为学习动作预测的下流目标。本文转而把它研究为塑造继承多模态表示的力量。我们显示这种塑造有双重效应:它是形成动作兼容表示所必需的,但当动作监督被过直锚定施加于继承的多模态通路时,也会破坏支持语言侧处理与物体落地的表示。为解决该张力,我们引入Action QFormer:一个面向动作的查询式接口——用指令条件化的查询把继承的多模态信息重组为面向动作的表示,再交给下游动作生成。在零样本仿真到真实导航中:Action QFormer把平均闭环任务成功率从18.8%提升到56.3%,把固定指令动作生成正确率从22.5%提升到75.5%,并几乎消除分布外指令生成。进一步分析显示:Action QFormer改变动作监督塑造继承多模态表示的方式——减少大范围的上游改写,同时保留定向的、有时是建设性的动作监督适配。结果表明改进VLA不仅需要更强的预训练骨干,还需要更好的方式来选择与组织继承的多模态信息、并控制它在动作监督下如何被塑造。
