论文
无声破坏:内部状态触发对 LLM 驱动的机器人系统的后门攻击
Silent Sabotage: Internal State Triggered Backdoor Attacks on LLM-Powered Robotic Systems
摘要
将大型语言模型 (LLM) 集成到机器人控制系统中,使新一代自主代理能够进行复杂的推理和规划。虽然这种范式转变加速了进步,但它也带来了很大程度上尚未探索的新型安全风险。目前对 LLM 后门的研究主要集中在外部刺激触发的攻击,例如特定单词、视觉对象或环境状态。这些攻击虽然有效,但却忽视了一种更隐蔽的漏洞,其中触发因素是代理自身操作逻辑的内部。本文首次全面研究了针对 LLM 驱动的机器人系统的基于历史的后门攻击。我们证明攻击者可以通过操纵指令将隐形后门嵌入到基于 LLM 的机器人控制器中。这个后门不是由外部提示触发的,而是由机器人自己过去的一系列特定的、罕见的动作触发的。它在正常操作期间保持休眠状态,保留机器人的效用,但可以被激活以引发恶意行为,例如完全停止或碰撞。我们在具有各种机器人和大语言模型的模拟环境中进行的实验表明,这种基于历史的攻击非常有效,实现了近乎完美的攻击成功率,同时仍然非常难以检测。这些发现揭示了自治系统中一个以前未解决的关键漏洞,并强调迫切需要采取安全措施来解释代理的内部状态。