论文
离散强迫:为少步行动专家将离散指导融入连续去噪中
Discrete Forcing: Infusing Discrete Guidance into Continuous Denoising for Few-Step Action Experts
摘要
视觉-语言-动作(VLA)模型中的高效动作生成需要捕获粗略的动作结构和细粒度的细节。离散动作标记提供紧凑的结构表示,但牺牲精度,而连续动作标记提供高精度,但通常需要多个去噪步骤。我们引入了离散强制,这是一种流匹配框架,它通过显式的从粗到细的生成过程组合这些表示。它首先预测离散的动作标记以建立粗略的动作结构,然后使用它们来指导连续的动作细化。离散和连续组件与专用分支共享一个公共扩散Transformer主干,保持与传统单分支模型相当的参数计数,同时每个分支仅需要一次前向传递。跨多个基准的广泛评估表明,与参数匹配的连续行动专家相比,性能得到了改善,推理速度更快,并且随着模型容量的增加,性能得到了一致的提高。现实世界的实验进一步证明了高精度和动态操作任务的改进。