论文
HALO-WA:世界动作模型的混合注意力潜在引导在线强化学习
HALO-WA: Hybrid-Attention Latent-Guided Online Reinforcement Learning for World-Action Models
摘要
世界动作 (WA) 模型可以生成用于通用机器人操作的长视野动作块,但它们在现实世界的精确任务中仍然容易受到校准、感知和接触动力学错误的影响,常常在最后几毫米的对齐或插入中失败。我们提出了 HALO-WA,一种用于 WA 模型的混合注意力潜在引导在线强化学习 (RL) 框架,它通过轻量级的 Actor-Critic 适配器利用 WA 生成过程中的潜在特征和动作先验,以实现快速在线适应实际部署错误。 HALO-WA 引入了一种混合注意力结构,该结构保持动作块的时间一致性,同时从以视觉上下文和末阶段校正要求为条件的 WA 潜在变量中读取任务相关信息,从而产生精细的动作块。我们在四个现实世界的精确操作任务上验证了 HALO-WA,它的平均成功率从基于 WA 的 26.4% 提高到 87.1%,比最强基线高出 19.2 个百分点,而每个任务只需要 45--75 分钟的在线训练。为了促进重现性,我们进一步在 RoboTwin 中进行补充模拟实验,并将代码发布在 https://github.com/YeanRoot/HALO-WA。