论文

样条策略:机器人策略的结构化表示

Spline Policy: A Structured Representation for Robot Policies

模型推理解码与生成控制

摘要

现代机器人操作的模仿学习策略通常将动作表示为固定分辨率的动作块,这些动作简单而有效,但在执行之前暴露了有限的几何和时间结构。本文研究了样条策略(SP),这是一种结构化表示,用样条参数替换动作块,同时保持策略主干不变。预测的样条可以被解码为紧凑的连续轨迹,以不同的时间分辨率进行查询,在参数空间中进行约束或编辑,并传递到下游控制器。对于二次样条输出,相同的表示也可以通过解析距离场构造转换为状态相关矢量场。在这种结构的规律性和投影假设下,诱发的动力学不会增加到生成的样条线的距离,从而产生围绕预测运动的原则上的局部校正机制。样条输出进一步支持从观测到样条参数、轨迹和流场的不确定性传播,并且可以与经典控制机制(例如零空间碰撞避免)相结合,而无需重新训练策略主干。我们用扩散、流程匹配、基于 Transformer 和视觉-语言-动作主干来实例化 SP。低维运动学习、匹配骨干下的模拟操作、灵巧操作和真实机器人案例研究等方面的实验表明,SP 仍然与现代策略学习器兼容,同时暴露出有用的运动结构属性,包括紧凑解码、时间重采样、围绕预测运动的局部校正、不确定性评估和控制器兼容性。