论文

智能体为何在压力下妥协安全

Why Agents Compromise Safety Under Pressure

模型评测安全与风险评测

摘要

部署在复杂环境中的大语言模型(LLM)智能体经常面临最大化目标达成与遵守安全约束之间的冲突。本文提出一个名为“智能体压力”(Agentic Pressure)的新概念,用以刻画当合规执行变得不可行时出现的内生张力。我们证明,在这种压力下智能体会表现出规范漂移,即策略性地牺牲安全以保全效用。值得注意的是,我们发现先进的推理能力会加速这种下滑,因为模型会构建语言上的合理化说辞来为违规辩护。最后,我们分析了根本原因并探索了初步的缓解策略,例如压力隔离——通过将决策与压力信号解耦来尝试恢复对齐。

智能体为何在压力下妥协安全:论文配图
图1:“好智能体”悖论:用户请求并无恶意,但高紧迫性与资源死锁叠加,迫使智能体在安全与目标达成之间做出妥协。