论文
Safe Bilevel Delegation(SBD):多智能体系统运行时委托安全的形式化框架
Safe Bilevel Delegation (SBD): A Formal Framework for Runtime Delegation Safety in Multi-Agent Systems
摘要
随着大语言模型(LLM)智能体被部署到高风险环境,如何安全地将子任务委托给专门子智能体成为关键问题。现有工作或在设计时处理多智能体架构选择,或提供宽泛的经验性指南,但都没有提供能在执行期间随任务上下文变化动态调整安全-效率权衡的运行时机制。我们提出Safe Bilevel Delegation(SBD),一个面向分层多智能体系统运行时委托安全的形式化框架。SBD将任务委托形式化为双层优化问题:外层元权重网络phi学习随上下文变化的[0,1]区间内安全-效率权重lambda(s);内层循环在概率安全约束P(safe) >= 1-delta下优化委托策略pi。取值于[0, 1]的连续委托度alpha控制向每个子智能体转移多少决策权,在完全人类接管(alpha=0)与完全自主执行(alpha=1)之间平滑插值。我们建立三项理论结果:(1) 安全单调性——外层安全权重越高,内层策略弱安全;(2) 内层策略收敛——在标准光滑性假设下,内层问题的投影梯度下降线性收敛;(3) 问责传播界——在多跳委托链上分配责任,并具有可证明的单智能体责任上限。我们在三个高风险领域实例化SBD——医疗AI(MIMIC-III)、金融风控(S&P 500)与教育智能体监督(ASSISTments)——并具体给出数据集、安全约束集、基线与评估协议。本稿完整呈现形式化框架与理论结果;按照文中所述协议开展的实证验证已在计划中,将在后续修订版中报告。