论文

Hermite 曲线作为视觉-语言-动作模型的轨迹先验

Hermite Curves as Trajectory Priors for Vision-Language-Action Models

模型训练监督微调与指令调优

摘要

尽管最近在用于机器人操作的视觉-语言-动作(VLA)模型方面取得了进展,但动作块仍然是一个弱结构化接口。现有的工作通常将每个块扁平化为每个时间步长的控制,依赖于隐式数据学习,在物理执行过程中表现为锯齿状运动和边界不连续性。为了解决这些限制,我们引入了 Hermite 轨迹先验,将块轨迹参数化为由端点位置和速度定义的分段三次 Hermite 曲线,以明确增强平滑性和连续性。我们通过三个变体在离散自回归和连续生成范式中实例化这个固定算子:(1)Hermite Tokens,它自回归预测量化边界变量; (2)Hermite Scaffold,将干净的动作分解为基础脚手架和残差; (3) Hermite正则化,严格应用先验作为辅助训练目标。在模拟基准和真实机器人平台上,Hermite 正则化在这三种变体中实现了卓越的性能,将 LIBERO 上的 π0.5 基线成功率从 95.9% 提高到 98.7%,在 LIBERO-plus 上从 85.7% 提高到 90.9%,在四个真实机器人任务中从 63.4% 提高到 90.0%,而无需额外的推理开销。轨迹分析表明,显式构建轨迹先验最有效地作为学习归纳偏差而不是运行时约束。