论文
停止关注提示:红队 LLM Agent的推理劫持和约束收紧
Stop Fixating on Prompts: Reasoning Hijacking and Constraint Tightening for Red-Teaming LLM Agents
摘要
随着基于 LLM 的代理在各个领域的广泛应用,其复杂性带来了新的安全威胁。现有的红队方法大多依赖于修改用户提示,缺乏对新数据的适应性,可能会影响代理的性能。为了应对这一挑战,本文提出了 JailAgent 框架,完全避免了修改用户提示。具体来说,它通过三个关键阶段隐式地操纵智能体的推理轨迹和记忆检索:触发提取、推理劫持和约束紧缩。通过精准的触发识别、实时的自适应机制以及优化的目标函数,JailAgent在跨模型、跨场景的环境中展现出了优异的性能。