论文

视觉-语言-动作模型的频率调节流匹配

Frequency-Conditioned Flow Matching for Vision-Language-Action Models

模型训练监督微调与指令调优

摘要

机器人动作是时间相关的轨迹,其频率分量以高度不均匀的能量分布对不同尺度的运动进行编码。然而,基于流匹配的视觉语言动作(VLA)模型通常会在时间坐标中生成动作,而无需明确建模或系统地利用这种频率异质性。我们引入了 \emph{FreqFM},一种用于 VLA 模型的频率调节流匹配框架。它将动作频率从隐式轨迹属性提高到跨越整个生成管道的显式调节维度。具体来说,在 DCT 频率坐标中,FreqFM 构建频谱匹配的源分布,自适应地平衡频率上的目标,并使用相应的参考传输尺度来约束每个频率的引导残差。 FreqFM 集成到现有的 Flow Matching 动作专家中,无需更改 VLA 主干。在 LIBERO、LIBERO-Plus 和 VLA-Arena 中,FreqFM 不断提高性能,包括比 LIBERO-Plus 提高 9.3 点,并进一步证明了其在六项真实机器人任务中的有效性。