论文
MANIGUARD:基于规范的安全评估和机器人操作改进的基准和数据套件
MANIGUARD: A Benchmark and Data Suite for Specification-Grounded Safety Evaluation and Improvement of Robotic Manipulation
摘要
机器人操作基础模型的任务成功率不断提高,但对能否安全完成任务的严格评估仍不足。ManiGuard包含安全规范驱动的评测套件和带安全标注的轨迹生成流程。ManiGuard-Bench按技能与约束划分六类涉及大量接触操作的家务任务,固定200个基础任务,并独立定义安全要求。每个任务包含一个分布内场景和四个单因素分布外扰动场景,保持安全规范不变,共形成1000个固定场景。在仿真和真实Franka平台上,每条执行轨迹都由基于有限轨迹线性时序逻辑LTL_f的自动机监视器检查物理谓词,而非依赖学习型分类器或LLM评判。轨迹生成流程结合自动运动规划和人工遥操作,由同一逐步监视器标注,支持安全微调。研究发布8000条安全标注示范,每个基础任务40条。对零样本和微调后的VLA开展超过23000条轨迹评测后发现:6%–21%的成功轨迹仍违反安全规范,因此安全必须独立于任务成功衡量;微调将安全完成率从接近零提高到7.5%–29.8%,投入任务且保持安全的行为比例从16%–40%提高到51%–72%。然而,扩大示范规模未消除差距,21%–42%的投入任务轨迹仍违规,六类任务中有两类在所有策略下的安全成功率均低于2%,这些问题在分布偏移和真实硬件上仍存在。