论文
SplineWAM:通过 B 样条表示的世界行动模型的自适应行动视野
SplineWAM: Adaptive Action Horizons for World Action Models via B-Spline Representations
摘要
世界动作模型 (WAM) 是大型具体策略,可联合预测未来视频和要执行的动作,为每个推理调用发出固定长度的动作块。这种策略在时间上统一分配其计算预算,无法在自由空间运动上执行更长时间,也无法在接触丰富的操作上花费更多的推理,这限制了 WAM 在云中提供服务时可以达到的吞吐量。我们提出了 SplineWAM,它自适应地将动作轨迹压缩到固定大小的三次 B 样条参数窗口中,使结时间适合运动的特征。然后,一个参数预算解码为不同时间分辨率和持续时间的块,并且执行的跨度和直到下一个策略调用的间隔都来自预测本身。将视频监督与演示的拟合结时间而不是统一网格对齐,可以集中动作轨迹复杂的监督帧。对于异步部署,我们引入了雅可比回拉实时分块(JP-RTC),它将块连续性强加于机器人执行的解码原始动作而不是样条参数上,并通过解码器更正参数,以便执行的前缀与已提交的动作一致。在 LIBERO-Plus 和 RoboCasa 上,SplineWAM 比动作分块 WAM 的成功率提高了 8.2和4.4个百分点,同时将每集的策略调用减少了 22% 和 26%。在异步执行下的三个双手真实机器人任务中,它领先或匹配基线,同时解码每次调用执行运动的 1.2 至 1.6 倍。