论文

重新审视可推广机器人操作的具体思想链

Revisiting Embodied Chain-of-Thought for Generalizable Robot Manipulation

模型训练监督微调与指令调优

摘要

具身思想链(CoT)旨在架起语言推理和机器人控制的桥梁,但其有效形式和集成策略仍未得到充分探索。在本文中,我们重新审视大规模视觉-语言-动作(VLA)模型的体现 CoT。我们构建了迄今为止最大的体现 CoT 语料库,包括 978,743 条轨迹、2.263 亿个样本和 2592.5 小时的机器人数据。通过大量的实验,我们发现有效的体现 CoT 应该将高级语义理解转化为具体的动作指导,例如末端执行器运动描述和图像空间轨迹,而仅高级推理只能带来边际收益。我们进一步表明,显式 CoT 在用作自回归动作前缀时不能可靠地扩展,因为它会遭受复合推理错误和不稳定的推理-动作耦合的影响。为了解决这些限制,我们提出了 ERVLA,这是一种 VLA 模型,它使用体现的 CoT 作为表示塑造监督,而不是强制性的测试时推理。 ERVLA 采用推理 dropout 策略进行训练,使模型能够在训练过程中吸收丰富的推理痕迹,同时在推理过程中直接预测动作,无需 CoT 解码。此设计通过增加 预训练 数据来提高可扩展性,并避免自回归不稳定。 ERVLA 在 LIBERO-Plus 上以 86.9% 的成功率实现了最先进的性能,在 VLABench 上达到了 53.2% 的成功率,展示了强大的分布外泛化能力。在真实的机器人实验中,ERVLA 的性能进一步优于竞争性的最先进基线,尤其是在需要语义消歧和长期执行的任务上。