论文
将大语言模型用于具身规划会引入系统性安全风险
Using large language models for embodied planning introduces systematic safety risks
摘要
大语言模型越来越多地被用作机器人系统的规划器,然而它们的规划有多安全仍是一个悬而未决的问题。为系统性地评估安全规划,我们提出DESPITE基准,包含12,279个任务,涵盖物理性与规范性危险,并具备完全确定性的验证。在23个模型上,即使近乎完美的规划能力也不能确保安全:规划能力最强的模型仅在0.4%的任务上未能产出有效规划,却在28.3%的任务上产出危险规划。在从3B到671B参数的18个开源模型中,规划能力随规模大幅提升(0.4-99.3%),而安全意识却相对平坦(38-57%)。我们识别出这两种能力之间的乘性关系,表明更大的模型之所以能更安全地完成更多任务,主要靠的是规划改进而非更好的危险规避。三个专有推理模型达到明显更高的安全意识(71-81%),而非推理的专有模型和开源推理模型仍低于57%。随着前沿模型的规划能力趋于饱和,提升安全意识成为在机器人系统中部署语言模型规划器的核心挑战。
