论文

边界处的治理:Agent分解如何削弱策略合规

Governance at the Boundary: How Agent Decomposition Degrades Policy Compliance

智能体系统Agent HarnessAgent任务评测

摘要

现有Agent基准问的是Agent是否完成了任务。我们问的是它是否在策略之内完成了任务。我们提出Fiducia-bench,一个衡量金融Agent可治理性的基准——该升级时是否升级、该拒绝时是否拒绝、是否留下可审计的轨迹——并用它研究一个此前没有基准涉及的问题:把Agent分解为多个组件是否会削弱其治理?答案是会,且机制具体:由一个组件发现的与策略相关的事实,在交接边界处被衰减,之后才到达必须据此行动的组件。在覆盖100个KYC/AML任务变体、两个模型、三种架构的626回合实验中,一个32B开源权重模型在单循环基线下衰减0%的已发现事实,在固定流水线下衰减56%,在编排器-子Agent架构下衰减85%(均在约束距离2处)。一个更强的模型(gpt-4.1-mini)在相同条件下衰减3-6%,表明分解的治理成本部分是模型能力的函数。关键是,同一机制既产生升级不足也产生升级过度,取决于被丢弃的事实是风险信号还是开脱信号。基准、全部任务与验证工具均已开源。