论文
从提示到实际行动:对 LLM 介导的机器人控制系统的结构化后门攻击
From Prompt to Physical Action: Structured Backdoor Attacks on LLM-Mediated Robotic Control Systems
摘要
将 大语言模型 (LLM) 集成到机器人控制管道中可实现将用户提示转换为可执行命令的自然语言界面。然而,这种数字到物理的接口引入了一个严重且未被充分开发的漏洞:微调 期间嵌入的结构化后门攻击。在这项工作中,我们通过实验研究了 LLM 介导的 ROS2 机器人控制系统中基于 LoRA 的供应链后门,并评估了它们对物理机器人执行的影响。我们针对命令生成管道的不同阶段构建了两个中毒的 微调 策略,并揭示了一个关键的系统级见解:嵌入在自然语言推理阶段的后门不能可靠地传播到可执行控制输出,而直接与结构化 JSON 命令格式对齐的后门成功地在翻译中幸存下来并触发物理操作。在模拟和现实实验中,后门模型的平均攻击成功率达到 83%,同时保持超过 93% 的干净性能精度 (CPA) 和亚秒级延迟,展示了可靠性和隐蔽性。我们进一步使用辅助 LLM 进行语义一致性检查来实现代理验证防御。尽管这将攻击成功率 (ASR) 降低至 20%,但会将端到端延迟增加至 8-9 秒,从而暴露了实时机器人系统中显着的安全响应性权衡。这些结果突出了 LLM 介导的机器人控制架构中的结构漏洞,并强调了对具身AI系统的机器人感知防御的需求。