论文
ActiveWAM:世界行动模型的证据感知主动愿景
ActiveWAM: Evidence-Aware Active Vision for World-Action Models
摘要
主动视觉操纵需要一种策略来控制其相机及其末端执行器,而相机运动决定了哪些证据在有限的观察窗口内仍然可见。获得新的观点可能会取代关键任务的线索,而保留观点会放弃潜在有用的观察结果。我们将其表述为一个证据感知的保留-获取问题,并提出 ActiveWAM,这是一个统一的世界-行动模型,可以共同学习观察和操作。为此,我们提出训练时间反转,它通过任务承载源证据和可见的时间变化来限制冻结视频,从而消除测试时间反转或候选排名的需要。在部署时,该策略根据视图感知历史记录生成双手和平移/倾斜操作(包括停留和重新获取行为),并根据新测量的 RGB 观察结果更新上下文。未来视频预测充当协同训练信号,而动作生成既不需要未来视频解码,也不需要最佳视点注释。我们推出 RoboTwin-AV,这是一个包含 50 项任务的基准测试,具有可执行的平移/倾斜控制和自动生成的演示。 ActiveWAM 将 TAVIS 分销外成功率比最强基线提高了 17.0 个百分点,在 RoboTwin-AV 上比 Fast-WAM 多实现了 20.0 个百分点,并且在实际物理厨房任务中比 Fast-WAM 高出 26.7 个百分点。