论文

VGAS:面向少样本视觉-语言-动作适配的价值引导动作块选择

VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation

模型推理推理验证与自校正

摘要

视觉-语言-动作(VLA)模型将多模态推理与物理控制衔接起来,但在示范稀缺的情况下将其适配到新任务仍不可靠。尽管微调后的VLA策略常能产生语义上合理的轨迹,但失败往往源于未被消解的几何歧义:在有限监督下,险些命中(near-miss)的动作会导致截然不同的执行结果。我们从“生成-选择”的视角研究少样本VLA适配,并提出一个新框架VGAS(价值引导的动作块选择)。它在推理时执行best-of-N选择,以识别既忠实于语义又在几何上精确的动作块。具体而言,VGAS用一个微调后的VLA作为高召回候选生成器,并引入Q-Chunk-Former——一个以几何为依据的Transformer评论家——来消解细粒度的几何歧义。此外,我们提出显式几何正则化(EGR),它塑造一个具区分性的价值图景,以在险些命中的候选之间保持动作排序的分辨力,同时缓解监督稀缺下的价值不稳定。实验与理论分析表明,VGAS在有限示范与分布偏移下持续提升成功率与鲁棒性。代码可在 https://github.com/Jyugo-15/VGAS 获取。

VGAS:面向少样本视觉-语言-动作适配的价值引导动作块选择
图2:VGAS 的总体框架。生成:经微调的 VLA 策略根据多模态输入提出 N 个候选动作块。选择:Q-Chunk-Former 通过 EGR + TD 目标学习评分函数 Q。Best-of-N 选择通过在由 EGR 塑造的判别性价值面上取最大值来定义诱导策略 π_μ,Q^(N),优先选择与专家对齐的候选,从而缓解几何漂移。