论文
AuthGuard-R:把任务授权与物理安全分成两道门
AuthGuard-R: Safety-Compliant Mission Hijacking and Dual-Gate Defense for LLM-Controlled Robots
摘要
大型语言模型越来越多地用作移动机器人、机器人操纵器和自动驾驶车辆的高级规划器。最近的研究表明,这些系统可能会受到恶意文本、语音、视觉指令、检索到的文档和中毒的感官环境的影响。大多数防御都会询问拟议的行动是否物理安全。本文研究了一个不同的问题:一个动作可能在物理上是安全的,但仍然违反了用户授权的任务。攻击者可能会重定向送货机器人、替换已批准的物体、扩展机器人的操作区域、激活不必要的传感器或延迟任务,而不会造成直接的物理危险。我们将这种攻击称为满足安全约束的任务劫持。我们提出 MissionPAIR,一种自适应攻击框架,用于搜索在违反经过身份验证的任务时通过安全门的可执行计划。我们还提出了 AuthGuard-R,一个确定性授权层,它将每个可执行操作绑定到签名的任务、机器人身份、对象和区域范围、当前状态、时间和输入来源。 AuthGuard-R 采用独立的安全门运行,提供双门架构。我们将机器人踪迹的任务策略形式化,定义安全博弈,并证明授权健全性、任务不升级、重放阻力、机器人绑定、来源分离、阈值批准安全、审计日志篡改证据和踪迹级组合。我们报告了与 Claude Haiku~4.5 和开源 Qwen2.5~7B 规划器的初步跨模型评估。在 240 次实时攻击试验中,规划器在 109 次试验中遵循了注入的任务偏移; AuthGuard-R 拒绝了所有 109 个由此产生的未经授权的操作。一套单独的手工构建的十一种协议和策略级攻击也被完全阻止。