论文

当机器人听错指令:刻画语音控制具身AI的安全风险

When Robots Mishear Us: Mapping the Safety Risks of Voice-Controlled Embodied AI

模型评测安全与风险评测

摘要

我们研究用户输入中的自动语音识别 (ASR) 错误是否会导致 Embodied AI (EAI) 模型的不安全输出。我们发现 ASR 错误可能导致 EAI 模型接受并执行有害指令,从而降低安全性。我们模拟 ASR 错误,并将其与现有安全基准(SafeAgentBench 和 POEX)相结合,以评估不同错误如何影响具体的 AI 安全。我们发现其中一些保留了语义结构,但增加了有害的歧义,而另一些则削弱了模型拒绝行为并允许生成和执行不安全的计划。我们表明,在某些情况下,自动纠正 ASR 错误可以降低风险,但这并不总是有效。总体而言,我们表明 ASR 错误会给嵌入式人工智能带来重大安全风险。

当机器人听错指令:刻画语音控制具身AI的安全风险:论文配图
图1:由POEX对抗性后缀引发的不安全可执行政策实例(Lu等人,2024年)。