论文

ESP:能量评分训练的一步多模态动作策略

ESP: Energy-Score Policy for One-Step Multimodal Action Generation

模型训练监督微调与指令调优

摘要

基于扩散和流程匹配的生成动作模型已越来越多地在视觉-语言-动作(VLA)策略中采用,因为它们能够捕获不同的行为,包括在相同观察和指令下的多个有效动作序列。然而,它们的迭代采样过程需要重复的网络评估来生成每个 动作块,从而增加了闭环控制中的推理延迟。我们提出了 ESP(Energy-Score 策略),这是一种无 教师模型 的方法,可在单个网络评估中将策略上下文和噪声直接映射到 动作块。 ESP 使用能量得分而不是均方误差来训练动作头。尽管平方误差回归以条件均值为目标,但能量得分是严格正确的:其期望值被目标分布唯一最小化。这为学习多模态动作分布提供了一个原则性目标,无需迭代采样,并且当模型可以表示目标分布时,可以在总体最佳状态下精确恢复。模拟和现实操作任务的实验表明,具有竞争力的 任务成功率 的动作生成延迟远低于流匹配基线。这些结果支持直接分布式学习作为迭代生成机器人策略的有效替代方案。

ESP:能量评分训练的一步多模态动作策略:论文原图
图 1:用于一步多模式动作生成的 Energy-Score 策略 (ESP)。流匹配可以生成多模态动作,但需要在多个网络评估上集成速度场 (NFE${>}1$)。均方误差 (MSE) 回归是单步 (NFE${=}1$),但会折叠到条件均值,无法表示多模态。经过严格正确的能量评分训练后,ESP 在一次网络评估 (NFE${=}1$) 中生成多模态动作。