论文

通过噪声空间轨迹优化实现一步生成策略的安全实时策略引导

Safe Real-Time Policy Steering via Noise-Space Trajectory Optimization for One-Step Generative Policies

智能体系统Agent 规划

摘要

生成机器人策略可以代表多样化的多模式行为,但使预训练策略适应部署时间限制(例如避免碰撞和方向保持)仍然具有挑战性。现有的推理时间引导方法通常通过迭代扩散或流动过程应用梯度引导,这对于实时控制来说计算成本可能很高。我们提出了 INSPO,它将一步生成策略的推理时间引导制定为策略输入噪声空间中的轨迹优化。通过优化输入噪声,同时评估诱导状态轨迹的约束,INSPO 搜索策略诱导的行为空间,而不直接修改生成的动作。优化包括一个正则化项,该项鼓励解决方案与策略的输入分布保持一致,并使用基于群体的粒子优化在线解决。我们评估了 INSPO 基于状态和图像的特定任务策略以及跨 Push-T、Can pick-and-place 和 LIBERO-Spatial 的通用视觉-语言-动作策略。与 N 次最佳采样和动作预测相比,INSPO 提高了任务成功率和约束满意度,同时在较低运行时间下与梯度引导生成相比具有优势。