论文
监督有容量:把智能体护栏校准到疲劳的主观人类
Oversight Has a Capacity: Calibrating Agent Guards to a Subjective, Fatiguing Human
摘要
当 LLM 代理开始采取真实的、不可逆转的操作(shell 命令、文件编辑、部署)时,标准安全模式是人机交互审批门:危险操作暂停并等待人员。我们认为大门是最容易的部分;困难的部分是判断——要停止哪些行为——该领域根据两个错误的假设来评估判断:存在“风险”的真实概念,以及人类审查者是完美的、无限可用的预言家。在一组手工标记的 125 个对抗加权代理操作中,我们表明 (i) 审阅者仅对风险有一定程度的认同 (Fleiss' kappa = 0.52),因此不存在单一正确的标签; (ii) 将警卫队定义为非对称成本下的选择性分类,使其操作限制可测量,并且在硬输入上,警卫队无法安全地自动决策; (iii) 当审核者被建模为内生的(随着升级负载的增长而疲劳)时,已实现的安全性在升级率中变成倒 U 形:更多的人为监督可能会降低系统的安全性,并且安全最优防护会升级到完全升级以下 - 负载感知策略的设置也用于抵御洪水攻击,从而使恶意操作溜过疲劳的审核者。以这种方式构建的智能体监督不仅是一个分类问题,而且是一个资源分配问题:人类的注意力是有限的,而警卫的升级政策却消耗了它。我们声称这些机制都不是新颖的——疲劳感知学习延迟(FALCON)、工作负载限制下的成本敏感延迟(DeCCaF)、轨迹级保护和审阅者疲劳/洪水攻击都是我们引用的现有技术。我们的贡献是一个开源代理监督系统,该系统可以在大语言模型代理行动门控设置中对它们进行操作和测量,从而转变“我的守卫好吗?”从猜测变成曲线。倒 U 形和洪水攻击是激发人类研究的建模结果。
