论文
TACO:触觉世界模型作为可扩展机器人策略的自我校正器 后训练
TACO: TActile World Model as a Self-COrrector for Scalable Robot Policy Post-Training
摘要
视觉-语言-动作模型和世界动作模型在机器人操作中显示出有希望的通用性,但在接触丰富的任务中仍然脆弱,其中接触扰动可能导致仅通过视觉很难检测到的故障。具有触觉反馈的纠正性 后训练 可以改善恢复,但通过人为干预来扩展此类监督的成本很高。世界模型可以合成额外的训练数据,但仅视觉生成可能会产生视觉上合理但接触不一致的轨迹。因此,我们引入了 TACO,这是一个基于组合触觉世界模型构建的可扩展机器人策略 后训练 框架。在实际部署的情况下,TACO 遵循“识别-想象-标签”循环:逆动态和价值模型使用进度估计来识别故障相邻状态,视觉触觉生成模型通过联合生成视频和触觉序列来想象局部纠正,逆动态和价值模型用纠正措施和进度分数来标记它们。根据运动学可行性和触觉合理性筛选候选者,然后根据预测的进度增益进行选择。 TACO 聚合了迭代 后训练 的演示、实际部署和选定的修正。它使用二进制优势标签将知识隔离的触觉适应与 CFG-RL 结合起来,同时保持预训练的 VLM 主干固定。对现实世界任务的实验表明,经过两次 后训练 迭代后,TACO 将平均任务得分从 0.375 提高到 0.825。