论文
DiscreteRTC:离散扩散策略是天然的异步执行器
DiscreteRTC: Discrete Diffusion Policies are Natural Asynchronous Executors
摘要
与聊天机器人不同,物理人工智能必须在世界不断发展的过程中采取行动。因此,无论推理速度有多快,同步执行器的块间暂停对于动态任务来说都是致命的。因此,异步执行(边思考边行动)是一种结构要求,而实时分块 (RTC) 通过将块转换重铸为修复:冻结已提交的操作并持续生成剩余部分,使其变得可行。然而,具有流匹配策略的 RTC 在结构上并不是最优的:它的修复来自于推理时间校正而不是基本策略,几乎没有带来 预训练 的好处、特定的 微调、启发式指导以及增加延迟的额外计算。在这项工作中,我们观察到离散扩散策略通过迭代揭开生成动作,是自然的异步执行器,可以立即解决所有限制:它们是 微调 自由的,因为修复是它们的本机操作,而提前停止进一步提供了自适应指导并降低了推理成本。我们提出了 DiscreteRTC,它用本机去屏蔽取代了外部校正,并在动态模拟基准和现实世界的动态操作任务中表明,它比连续 RTC 和其他基线具有更高的成功率。总之,DiscreteRTC 更容易实现,只需 0 行额外代码即可实现异步修复,与从头开始生成动作相比,推理速度更快,计算量仅为约 0.7,并且执行效果更好,与流匹配 RTC 相比,在现实曲棍球防守任务中的成功率高出 65%,与训练时流匹配 RTC 相比高出 30%。更多可视化位于 https://outsider86.github.io/DiscreteRTCSite/。