论文
$τ_0$-VLA:具有世界模型引导测试时间计算的分层机器人基础模型
$τ_0$-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation
摘要
长视野机器人操作要求机器人既能可靠地执行个人技能,又能在扩展任务中连贯地对它们进行排序。大多数分层视觉-语言-动作(VLA)模型通过一次前向传递做出每个此类决策,没有留下任何机制来为困难或后果性选择分配额外的计算。我们引入了$τ_0$-VLA,这是一种分层机器人基础模型,它通过世界模型引导的测试时间计算将高级子任务生成制定为计算可扩展的推理问题。在每个推理步骤中,高级策略使用执行内存来生成子任务,并在需要时在提交其输出之前搜索替代方案。然后,底层策略跨多个机器人形态执行生成的子任务。该策略接受了 40,115 小时的异构现实世界数据和多模式协同训练的训练。在域内和分布转移的设置中,分配额外的测试时间计算大大提高了下一个子任务的预测准确性,并且这些收益转化为长视野机器人操作任务的更高闭环成功率。