论文

将大语言模型用于具身规划会引入系统性安全风险

Using large language models for embodied planning introduces systematic safety risks

模型评测安全与风险评测

摘要

大语言模型越来越多地被用作机器人系统的规划器,然而它们的规划有多安全仍是一个悬而未决的问题。为系统性地评估安全规划,我们提出DESPITE基准,包含12,279个任务,涵盖物理性与规范性危险,并具备完全确定性的验证。在23个模型上,即使近乎完美的规划能力也不能确保安全:规划能力最强的模型仅在0.4%的任务上未能产出有效规划,却在28.3%的任务上产出危险规划。在从3B到671B参数的18个开源模型中,规划能力随规模大幅提升(0.4-99.3%),而安全意识却相对平坦(38-57%)。我们识别出这两种能力之间的乘性关系,表明更大的模型之所以能更安全地完成更多任务,主要靠的是规划改进而非更好的危险规避。三个专有推理模型达到明显更高的安全意识(71-81%),而非推理的专有模型和开源推理模型仍低于57%。随着前沿模型的规划能力趋于饱和,提升安全意识成为在机器人系统中部署语言模型规划器的核心挑战。

将大语言模型用于具身规划会引入系统性安全风险:论文配图
图 5:DESPITE 数据集和生成管道。 a,按数据源、任务设置、危险组、危险类型和危险实体组成的数据集。 12,279 项任务涵盖各种环境,既有物理危险(机械、热、化学、电气),也有规范危险(隐私、信任违规)。面临风险的实体包括人类、机器人和其他(环境、周围物体)。 b、规划复杂度分布。每个单元格显示该坐标处的任务计数(平均计划长度、安全工作量)。配送中心围绕 (5, 1):典型任务需要大约 5 项操作来解决,安全计划比不安全但可行的计划多需要 1 项操作。 c,数据生成管道。异构源(任务规划基准、社会规范数据库、医院伤害记录)通过特定源适配器进入统一的危险形式化模式。代码生成生成定义每个计划任务的 Python 脚本,并通过执行和质量检查进行迭代细化。最终的人工审核可确保逻辑完整性和实践有效性。该管道的每个经过验证的任务的 API 成本为 0.011 美元,从而能够经济高效地扩展到 12,279 个任务。