论文
打破规划器完整性边界:对 LLM 驱动的具体代理的环境状态文本注入攻击
Breaking Planner Integrity Boundary: Enviroment State-Text Injection Attack on LLM-Driven Embodied Agents
摘要
大语言模型 (LLM) 驱动的实体代理依靠环境状态来解释场景、生成高级计划并驱动物理执行,从而使规划者可见的状态表示成为关键的安全边界。现有的攻击主要操纵用户指令、提示上下文、模型行为或感知输入,而对环境状态文本本身是否可以充当欺骗性任务证据并传播到计划之外以影响执行结果的关注有限。由于具体任务受到实体基础、行动先决条件、空间关系和环境约束的约束,仅计划偏差并不能保证对抗性执行。为了解决这一差距,我们将环境状态文本作为独立的攻击面进行研究,并提出了针对 LLM 驱动的体现代理的第一个闭环环境状态文本注入(ESTI)攻击。在不修改原始用户指令、模型参数或执行器的情况下,ESTI 将对抗性目标重新表述为与当前环境兼容的虚假状态证据,并通过对象属性、空间关系、可供性、任务阶段规则和执行反馈影响规划和执行。我们进一步开发 ESTI-Bench 来评估从规划到执行闭环的攻击传播,并将 ESTI 与 ProgPrompt/VirtualHome、VoxPoser/RLBench 和 AI2-THOR/iTHOR 上的 Vanilla IPI、EIRAD 和 BADROBOT 进行比较。 ESTI 始终优于现有基准,将计划级和执行级攻击成功率分别提高高达 89.32% 和 43.69%。进一步分析表明,基础性、一致性和可执行性共同决定了被操纵的状态证据是否可以通过体现的闭环传播并产生可验证的环境变化。