论文

多智能体LLM安全中的运营化重构与批准式委派

Operational Reframing and Approval-Framed Delegation in Multi-Agent LLM Safety

模型评测安全与风险评测

摘要

多智能体LLM系统的安全评估常比较直接提示与规划者—执行者管线,并把差异报告为单一“管线效应”。我们论证该聚合难以解读——它混淆三种机制:有害意图可能被重构为貌似合理的运营工作;规划者可能拒绝或转换请求;执行者可能在暗示事先批准的委派提示下行动。为分离这些因素,我们引入五条件受控对比设计——在30个合成有害场景与来自四个智能体安全基准的探索性外部验证集上、以LLM裁判的顺从度评估。结果显示:聚合的管线安全不是稳定的架构属性。运营化重构是最可移植的风险信号——在两个场景集上增加GPT、Gemini与DeepSeek的顺从度,而Claude相对抵抗。规划者行为主要可经拒绝抵消该风险;但当规划者产出可执行步骤时,执行者可能比直接运营基线更顺从。批准式委派对提示设计、模型配对与场景来源敏感——怀疑式执行者提示急剧降低顺从度。原始直接模型排名也可能误测部署的规划者—执行者行为:Gemini在主集的原始直接提示下最安全,却与Claude规划器配对时呈现最大放大——顺从度从8.9%升至38.9%。GPT近零的聚合管线效应实际隐藏了被规划者拒绝抵消的重构增加。结果提示:多智能体安全评估应在归因于架构本身之前,分别报告重构、规划者行为、委派框架与模型配对。