论文

为什么代理安全无法跨任务推广?

Why Does Agentic Safety Fail to Generalize Across Tasks?

模型评测安全与风险评测

摘要

人工智能代理越来越多地部署在多任务设置中,其中要执行的任务是在测试时指定的,并且代理必须泛化到看不见的任务。这种环境中的一个主要问题是安全:通常,代理不仅必须执行看不见的任务,而且还要在避免风险和处理实际发生的风险的同时执行。经验证据表明,即使执行能力可以推广到看不见的任务,但安全地执行任务的能力却经常不会。本文提供的理论和实验表明,代理安全无法跨任务泛化不仅仅是由于训练方法的限制,而且还可以反映安全本身的固有属性:任务与其安全执行之间的关系比任务与其单独执行之间的关系更为复杂。理论上,我们分析了具有 $H_{\infty}$-鲁棒性的线性二次控制,并证明在许多情况下,从任务规范到最优控制器的映射在有安全要求的情况下具有比没有安全要求时更高的 Lipschitz 常数,从而产生独立利益的 Lipschitz 界限。根据经验,我们在使用神经网络代理的模拟四轴飞行器导航和使用 LLM 代理的 CRM 中证明了我们的结论,表明在训练中看到的任务中,模仿安全和不安全的教师同样简单,但对于安全的教师来说,跨任务进行概括要困难得多。我们的研究结果表明,目前增强药物安全性的努力可能还不够,并表明需要采取根本不同的方法。