论文
面向机器人健康陪护控制的LLM安全性基准测试
Benchmarking the Safety of Large Language Models for Robotic Health Attendant Control
摘要
大语言模型(LLM)日益被考虑部署为机器人健康陪护的控制组件,但其在这一场景中的安全性仍缺乏充分刻画。我们构建了一个包含270条有害指令的数据集,涵盖以美国医学会医学伦理原则为依据的九类禁止行为,并用它在基于Robotic Health Attendant框架的仿真环境中评估了72个LLM。所有模型的平均违规率为54.4%,超过半数模型的违规率高于50%,且违规率在不同行为类别间差异显著,设备操纵和延误急救等表面上看似合理的指令被证明比明目张胆的破坏性指令更难拒绝。在开源权重模型中,模型规模和发布日期是安全表现的主要决定因素,且专有模型明显比开源权重模型更安全(违规率中位数23.7%对72.8%)。医疗领域微调未带来显著的整体安全收益,基于提示的防御策略仅在最不安全的模型中带来小幅下降,绝对违规率仍处于无法安全开展临床部署的水平。这些发现表明,在面向机器人健康陪护的LLM的开发与部署中,安全性评估必须被当作一等标准对待。