论文

SafeMCP:经环境锚定的功率调节 proactive 防御LLM智能体

SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning

智能体系统模型训练强化学习Agent 动作执行与治理智能体互操作协议RLVRMCP

摘要

随着大型语言模型 (LLM) 代理越来越多地利用模型上下文协议 (MCP) 在复杂环境中运行,其操作空间的扩展为代理提供了不安全的功能,并强调了权力寻求的风险。虽然广阔的行动空间和更大的环境影响对于完成任务至关重要,但它们创造了脆弱的风险面,轻微的错误或幻觉会被放大为灾难性的失败。作为回应,我们提出了 SafeMCP,这是一个{服务器端}防御插件,它通过对未来安全风险的预测推理来限制工具的获取。 SafeMCP 利用内部世界模型进行前瞻推理来实施两层防御:主动工具过滤以限制危险的功率扩展,并立即干预作为故障保护。为了训练 SafeMCP,我们引入了一个三阶段管道,包括环境动态锚定、安全策略初始化和具有双重可验证奖励的强化学习 (RL)。在 PowerSeeking Bench、ToolEmu 和 AgentHarm 上的实验表明,SafeMCP 实现了安全平衡,有效降低了风险,同时保留了代理效用。

SafeMCP:经环境接地的功率调节 proactive 防御LLM智能体:论文配图
图 1:(A) 寻求权力的风险与缓解风险。不受监管的代理会禁用防火墙以维持访问持久性。排除此工具会引导代理转向良性替代方案。 (B) SafeMCP 防御机制。一个两层服务器端插件,由主动工具过滤和立即拦截组成。