论文
能力最小化作为安全原语:面向最少特权智能体的风险感知因果门控
Capability Minimization as a Safety Primitive: Risk-Aware Causal Gating for Least-Privilege LLM Agents
摘要
现代决策系统越来越依赖于学习组件,其输出可能是自信的,但可能是错误的,从而使下游行动面临代价高昂的错误。我们引入了风险感知因果门控(RACG),这是一个框架,通过将因果效应估计与校准的风险控制相结合来决定是否采取行动、推迟或放弃模型的预测。 RACG 对从候选行动到结果的因果路径进行建模,并根据估计的反事实风险而不是原始的预测置信度来控制每个决策。为了使门控可靠,我们得出了在高风险条件下行动的概率的无分布界限,并展示了这些界限如何转化为满足用户指定的安全约束的操作阈值。我们进一步提出了一种自适应门控策略,通过监控预测结果和实现结果之间的差异来调整分布变化,并在因果假设似乎被违反时收紧门控。在模拟干预和现实世界的决策基准中,RACG 大大减少了高成本错误,同时保留了非门控政策的大部分效用,并且在匹配的弃权率下,它的表现优于基于置信度和选择性预测的基线。我们的结果表明,明确地将因果风险与预测不确定性分开可以产生更安全、更透明的决策系统,为高风险环境中值得信赖的自动化提供原则性机制。
