论文
超越任务成功:WAM 和 VLA 的行为和表征诊断
Beyond Task Success: Behavioral and Representational Diagnostics for WAM and VLA
摘要
视觉-语言-动作(VLA)策略和世界动作模型(WAM)代表了机器人操作的两个日益重要的范例。然而,目前尚不清楚 WAM 的未来预测是否会带来最终任务成功之外的行为上有意义的改进。在本文中,我们询问 WAM 是否仅仅添加未来预测,或者它们是否以可操作的控制方式改变机器人行为和内部表征。我们引入了一个与模型无关的诊断框架,该框架通过两个互补的镜头来比较 WAM 和 VLA:行为轨迹采样分析和基于稀疏自动编码器的特征分析。行为协议测量动作动态一致性、目标对象进展、干扰干扰和运行时间成本。特征空间协议将内部表示表征为记忆的、反应性的或预测性的,揭示模型是否编码面向未来的结构。在 LIBERO 和 RoboTwin2.0 中,我们评估了涵盖直接 VLA 以及联合、顺序和辅助 WAM 的 7 项策略。我们的结果表明,成功本身就隐藏了关键的差异:WAM 通常会改善对象级行为和目标选择性,但它们的收益取决于架构并会产生更高的推理成本。顺序WAM显示了最清晰的预测结构,而辅助WAM和联合WAM分别压缩或纠缠未来信息。这些发现表明了 WAM 设计的未来方向,以保留行为上可操作的未来表征,以实现有效的操作。