论文

能力最小化作为安全原语:面向最少特权智能体的风险感知因果门控

Capability Minimization as a Safety Primitive: Risk-Aware Causal Gating for Least-Privilege LLM Agents

智能体系统Agent 动作执行与治理

摘要

现代决策系统越来越依赖于学习组件,其输出可能是自信的,但可能是错误的,从而使下游行动面临代价高昂的错误。我们引入了风险感知因果门控(RACG),这是一个框架,通过将因果效应估计与校准的风险控制相结合来决定是否采取行动、推迟或放弃模型的预测。 RACG 对从候选行动到结果的因果路径进行建模,并根据估计的反事实风险而不是原始的预测置信度来控制每个决策。为了使门控可靠,我们得出了在高风险条件下行动的概率的无分布界限,并展示了这些界限如何转化为满足用户指定的安全约束的操作阈值。我们进一步提出了一种自适应门控策略,通过监控预测结果和实现结果之间的差异来调整分布变化,并在因果假设似乎被违反时收紧门控。在模拟干预和现实世界的决策基准中,RACG 大大减少了高成本错误,同时保留了非门控政策的大部分效用,并且在匹配的弃权率下,它的表现优于基于置信度和选择性预测的基线。我们的结果表明,明确地将因果风险与预测不确定性分开可以产生更安全、更透明的决策系统,为高风险环境中值得信赖的自动化提供原则性机制。

能力最小化作为安全原语:面向最少特权智能体的风险感知因果门控:论文配图
图 2:七个托管模型 (Amazon Bedrock) 的真实 LLM 高风险调用率(按暴露方法)。在RACG下,目标工具在注入步骤中被排除在𝒱t\mathcal{V}_{t}之外,因此每个模型的模型驱动高风险调用率为0.000.00; CMTF 在所有模型中重现其确定性泄漏 (0.250.25)。