论文
基于LLM的智能体中的策略不可见违规
Policy-Invisible Violations in LLM-Based Agents
摘要
基于LLM的智能体可能执行语法上有效、获得用户授权且语义上恰当的动作,却仍然违反组织策略,因为进行正确策略判断所需的事实在决策时刻是隐藏的。我们将这种失败模式称为策略不可见违规(policy-invisible violations):即合规性依赖于智能体可见上下文中缺失的实体属性、上下文状态或会话历史的情形。我们提出PhantomPolicy,一个覆盖八类违规类别、违规案例与安全对照案例均衡的基准,其中所有工具响应都只包含干净的业务数据,不含策略元数据。我们人工审查了五个前沿模型产生的全部600条模型轨迹,并使用经人工审查的轨迹标签对其进行评估。相对于原始案例级标注,人工审查改变了32个标签(5.3%),证实了轨迹级人工审查的必要性。为展示在有利条件下基于世界状态的执行机制能取得什么效果,我们提出Sentinel,一个基于反事实图模拟的执行框架。Sentinel将每个智能体动作视为对组织知识图谱的一次拟议变更,通过投机执行具体化动作后的世界状态,并验证图结构不变量来决定允许(Allow)/阻止(Block)/澄清(Clarify)。对照经人工审查的轨迹标签,Sentinel大幅优于仅基于内容的DLP基线(准确率68.8% vs. 93.0%),同时保持高精确率,但在某些违规类别上仍有改进空间。这些结果表明,一旦将策略相关的世界状态提供给执行层,就能实现此前无法达成的效果。