论文
CorridorVLA:通过稀疏锚点对生成动作头进行显式空间约束
CorridorVLA: Explicit Spatial Constraints for Generative Action Heads via Sparse Anchors
摘要
视觉-语言-动作(VLA)模型通常使用中间表示将多模态输入与连续控制连接起来,但空间指导通常通过潜在特征隐式注入。我们提出了 CorridorVLA,它将稀疏空间锚点预测为增量物理变化(例如,末端执行器 $Δ$ 位置),并使用它们在动作生成的训练目标中强加一个明确的容差区域。锚点定义了一个引导流量匹配动作头的容差走廊:隐含空间演化落在走廊之外的轨迹接受校正梯度,而走廊内的轨迹则通过一致性目标进行细化。 CorridorVLA 在 LIBERO 上将 SmolVLA 提高了 4.45 个百分点,在更具挑战性的 LIBERO-Plus 基准上将 SmolVLA 和 GR00T 分别提高了 12.37 和 7.98 个百分点。值得注意的是,在相同的单策略四合一环境下,即在所有任务套件中联合训练和评估一项策略,GR00T-Corr 实现了 83.21% 的成功率。这些结果表明,与行动相关的物理线索可以为生成行动政策提供直接且可解释的约束,补充以视觉或潜在形式编码的空间指导。代码和发布的模型检查点可在 https://github.com/lidc54/corridorVLA 和 https://huggingface.co/lidc/CorridorVLA 获取。