论文

组合式策略违规:为何智能体工作流逐步合规仍会整体违规

Compositional Policy Violations: When Step-Level Compliance Fails In Agentic AI Workflows

智能体系统Agent 动作执行与治理Agent Harness

摘要

智能体工作流如今在受监管场景中作出重要决策,而周边治理几乎完全以单步为范围,包括输入输出分类器、每轮防护和片段级评估器。组织实际持有的转交阈值、权限限制和复核要求等策略,却是整个执行过程的属性,而非任一步骤的属性。这种不匹配产生一种失效,我们称之为组合式策略违规CPV:每个步骤都通过自身检查,但组合后的执行违反治理策略。单步骤上的谓词无法评估不由该步骤决定的属性,因此无论怎样提高单步监控器准确率,都检测不到这一类别。我们把CPV定义为单步合规无法组合成立,并提出四种类型:权限蠕增、阈值洗白、累计总和违规和上下文坍缩。我们说明,每类问题的正确修复方式取决于受保护量在哪里发生变化。随后提出感知来源的运行时架构,对完整执行轨迹评估策略,并依据原始来源记录而非流水线的派生表示重新计算受保护量。

组合式策略违规:为何智能体工作流逐步合规仍会整体违规:论文配图
图1:组合式策略违规的分类体系。