论文

Embodied 智能体的越狱护栏基准测试

Benchmarking Jailbreak Guardrails for Embodied Agents

模型评测安全与风险评测

摘要

由大语言模型和视觉语言模型支持的体现智能体越来越多地部署在物理环境中,但越狱攻击可能会诱使这些智能体执行对身体有害的操作。人们提出了越来越多的护栏方法来在执行之前拦截危险行为,但现有的安全基准评估了具体模型本身,因此尚不清楚这些护栏在实践中实际防御具体智能体的效果如何。我们对智能体的越狱护栏进行了首次系统评估。为了在相同条件下比较护栏,我们构建了一个可插入的评估框架,将具体的智能体视为固定后端,将每个护栏视为可以在感知、规划或控制阶段进行干预的模块。我们对六种具有代表性的护栏进行了基于模板的自动化越狱攻击和安全指令,并从三个维度在系统层面对其进行了评估:防御有效性,通过模拟器中的绕过率和危险成功率来衡量;可用性,通过误报率和安全指令的任务完成率来衡量;和效率,通过运行时添加的延迟开销来衡量。对跨越不同干预阶段、决策机制和输入方式的护栏的实验揭示了三个维度之间的明显权衡,并表明没有单一护栏在所有设置中占主导地位。我们进一步分析了干预阶段、决策机制和输入方式如何塑造安全结果,并为具体的智能体护栏的选择和设计提供实用指导。