论文

PlanGuard:具身Agent多步骤计划的物理安全护栏

PlanGuard: A Guardrail for Multi-Step Plan Safety in Embodied Agents

智能体系统Agent 动作执行与治理Agent Harness

摘要

具身任务规划器可以生成多步骤计划,其子任务依赖性以及与环境的交互在执行期间产生物理风险。然而,现有的防护措施忽视了此类组合风险,因为通用护栏专注于语义损害,而具身安全检测器则单独评估子任务。为了解决这一差距,我们引入了 PlanGuard,这是第一个执行前检测器,用于评估完整的多步骤计划在当前环境中的物理安全性。为了训练和评估,我们通过配对任务构建、使用不同规划器生成计划以及三名评审的安全注释来构建多步计划安全(MSP-Safe)数据集。 MSP-Safe 上面向任务的 SFT 建立了基本的计划安全评估功能,但适合实时部署的紧凑模型与更强大但成本更高的大型模型之间仍然存在很大差距。因此,我们提出了on-policy蒸馏的强教师自适应补偿(STAC-OPD),它提供了紧凑的模型,沿着其on-policy轨迹具有自适应强教师监督。它将来自经过微调的强教师的词元级分布传输与概率路由序列级补偿相结合,当学生支持参考安全决策时保留学生生成的目标,否则使用教师重建的目标。在所有测试子集中,PlanGuard-2B 平均达到 87.15% ACC 和 87.21% F1,证明了在紧凑模型规模下有效的全计划物理风险检测。代码和数据集将公开发布。