论文
查看更少,指定更多:可推广 VLA 的视觉证据预算
See Less, Specify More: Visual Evidence Budgets for Generalizable VLAs
摘要
泛化仍然是视觉-语言-动作(VLA)模型的中心瓶颈:在干扰因素、外观变化和语义相似的任务下,策略通常必须从粗略指令中推断出本地执行细节,同时还要决定图像的哪些部分需要控制。我们提出了 S2(See Less,Specify More),这是一个通过在更清晰的界面下训练执行器来改进 VLA 泛化的框架。 “指定更多”将原始指令保留为稳定的高级目标,同时将每个轨迹重新标记为精炼的轨迹和子任务级语言,以消除当前执行模式的歧义。与原生注意力不同,See Less 施加了明确的视觉证据预算,训练执行者根据任务充足的证据而不是不受约束的视觉上下文采取行动,而无需任何区域或掩模注释。该界面使执行器能够遵循详细的指导,而无需依赖分散注意力的视觉补丁或自行解决可避免的歧义,并且它通过上下文学习与现成的 VLM 规划器保持兼容。在我们的主要评估设置中,S2 通过改变执行器的学习问题来改善整体泛化指标:粗略指令会导致可避免的监督混叠,目标保留本地指导在我们的主要消融中优于指令替换,并且显式证据预算减少了对效率考虑之外的广泛视觉上下文的依赖。在 TX-G2(AgiBot G2 兼容变体)和 HSR 上的八个真实机器人任务中,S2 将平均子任务成功率从 pi0.5 的 54.2% 提高到 79.0%。总之,这些结果表明,当执行者接受训练以根据信息丰富的本地指导和任务充足的视觉证据采取行动时,而不是从弱监督中恢复两者时,VLA 泛化能力会得到提高。