论文
PACT:实体操纵中扩散政策的自我演化物理安全联盟
PACT: Self-Evolving Physical Safety Alignment for Diffusion Policies in Embodied Manipulation
摘要
扩散策略在机器人操作方面取得了显着的成功,但它们往往无法满足安全部署所需的严格物理约束。现有方法要么在训练期间过早地施加安全性,要么在测试时通过外部护栏被动地施加安全性,从而限制了策略表达性和整体可扩展性。我们提出了约束轨迹的物理安全对齐(PACT),这是一个自我进化的 后训练 框架,它将预训练的扩散策略投影到约束可行的区域,而无需访问演示数据或任务奖励。 PACT 通过跨时间步长的密集监督的反向 KL 目标将约束梯度提炼到扩散模型中。它包含的课程逐步收紧约束,同时保持理论上有限的政策转变和单调改进,从而减轻灾难性遗忘带来的安全性能权衡。在模拟和现实世界的体现操纵基准上,PACT 平均将安全违规行为显着减少 31.0%,同时将任务成功率提高 30.7%。