论文

HAF:通过分层动作流和频谱潜在强化学习,使通才 VLA 适应人形全身局部操纵

HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL

模型训练强化学习

摘要

人形机器人作为以人为中心的环境中的通用代理具有广阔的前景,但通用视觉语言动作(VLA)基础模型并不容易适用于人形全身运动操作。人形运动的高维性和相互依赖性使得传统的单级 VLA 架构有效协调运动、腰部姿势和双臂操纵具有挑战性。此外,通过离线行为克隆训练的策略在实际部署过程中可能仍然不是最佳的。虽然在线强化学习可以通过现实世界的交互来完善策略,但直接调整大型 VLA 主干需要过多的计算,并且可能会在真实机器人探索过程中引入安全风险。为了解决这些瓶颈,我们引入了 HAF(人形适应框架),这是一个由 HAF-VLA 和 HAF-Steer 组成的两部分框架,可将现成的通用 VLA 基础模型转移到人形全身局部操纵。 HAF-VLA 是一种基于预训练流匹配 VLA 构建的分层动作流生成器。它将全身动作去噪分为三个连续阶段,并具有阶段嵌入和跨阶段 KV 缓存,保留运动学依赖性,避免一次性生成中不连贯的全身动作。在冻结的 HAF-VLA 之上,HAF-Steer 是一个潜在的离线到在线 RL 管道,它利用流匹配可逆性和基于 DCT 的降维来将 RL 优化限制在紧凑的噪声子空间并训练正则化的 SAC 策略。这避免了更新大型 VLA 主干网并实现高效的现实世界策略细化。经过对七项真实世界人形机器人局部操作任务的评估,HAF 超越了普通的单阶段 VLA 基线,并提高了全身协调性和任务表现。项目网站:https://grange007.github.io/HAF。