论文
ESP:能量评分训练的一步多模态动作策略
ESP: Energy-Score Policy for One-Step Multimodal Action Generation
摘要
基于扩散和流程匹配的生成动作模型已越来越多地在视觉-语言-动作(VLA)策略中采用,因为它们能够捕获不同的行为,包括在相同观察和指令下的多个有效动作序列。然而,它们的迭代采样过程需要重复的网络评估来生成每个 动作块,从而增加了闭环控制中的推理延迟。我们提出了 ESP(Energy-Score 策略),这是一种无 教师模型 的方法,可在单个网络评估中将策略上下文和噪声直接映射到 动作块。 ESP 使用能量得分而不是均方误差来训练动作头。尽管平方误差回归以条件均值为目标,但能量得分是严格正确的:其期望值被目标分布唯一最小化。这为学习多模态动作分布提供了一个原则性目标,无需迭代采样,并且当模型可以表示目标分布时,可以在总体最佳状态下精确恢复。模拟和现实操作任务的实验表明,具有竞争力的 任务成功率 的动作生成延迟远低于流匹配基线。这些结果支持直接分布式学习作为迭代生成机器人策略的有效替代方案。
