论文

跨视觉-语言-动作策略的以结果为条件的末端执行器几何形状

Outcome-Conditioned End-Effector Geometry Across Vision-Language-Action Policies

智能体系统Agent任务评测

摘要

视觉-语言-动作(VLA)策略通过不同的动作接口解决相同的操作任务,但任务成功本身并不能确定它们的物理执行是否一致。我们研究了来自四种策略的 15,000 次闭环 LIBERO 部署中的跨策略末端执行器几何形状。主要清洁条件分析形成 3,600 个配置匹配且因此相互依赖的策略对。当只有一个策略成功时,两个成功对的标准化动态时间扭曲距离中位数分别为 0.0120 m 和 0.0380 m。这种顺序适用于每个任务、每个策略对以及九个采样和带限表示;然而,该比率在不同的表示形式中存在数倍的变化,因此我们报告方向而不是固定的倍数。两个失败对再次更加分离,但依赖于薄弱的、不均匀的支撑,因此我们将它们报告为探索性的。在成功的执行过程中,合作伙伴替换在任务之间的分离比在初始状态之间的分离更多。匹配的基线仍然揭示了可测量的、异构的剩余政策差异,因此较低的跨政策距离并不意味着可互换性。成功的执行与相同任务演示之间的距离与这些演示之间的距离一样远,与任务相关的几何结构兼容,而无需将训练数据重叠与任务约束分开。常见的 72 个动作窗口保留了顺序,但降低了其幅度;终点和持续时间调整同样会相对于两个成功对留下正的混合结果系数,尽管其大小取决于规格。在复合视觉压力下,政策排名和配对构成一起变化。