论文
通过单机器人妥协在 LLM 控制的多机器人协作中传播不安全行为
Propagating Unsafe Actions in LLM Controlled Multi-Robot Collaboration via Single Robot Compromise
摘要
大语言模型 (LLM) 越来越多地用作体现智能中的通用规划器,为单机器人和多机器人协作实现高级协调和低级任务规划。这种对具体 LLM 规划器的日益依赖也引发了严重的安全问题,因为未对齐或被操纵的指令可以转化为物理动作。先前的工作已经研究了单个机器人设置中的此类威胁,而 LLM 控制的多机器人协作中的安全风险,特别是通过机器人间通信传播的安全风险,在很大程度上仍未得到探索。为了弥补这一差距,我们提出了一种新颖的多机器人系统攻击范例,其中对手仅与单个入口机器人进行交互。然后,受感染的机器人通过对等通信传播恶意意图,导致整个系统协调一致的不安全行为。我们的评估涵盖了玩忽职守、隐私泄露和公共安全危害等高风险维度,揭示了多机器人规划器中持续存在的安全一致性差距。我们用三个指标来量化这个过程:服从性、传染性和隐秘性。实验证明了攻击者的持续控制和快速传播:在最强的情况下,服从性达到 1.00,传染性上升到 0.90。值得注意的是,该攻击非常高效,只需 3.0 轮即可攻击所有机器人,同时保持 0.81 的隐秘性得分。当机器人必须在紧急情况或权利冲突等紧急情况下解决权衡时,这种风险就会被放大,因为协调机制可能会无意中允许对抗性指令凌驾于安全要求之上。该代码可从 https://github.com/TheFatInsect/InfectBot 获取。