论文

物理智能体的安全技能退役

Safe Skill Retirement for Physical Agents

智能体系统Agent 动作执行与治理Agent Skills

摘要

智能体技能把程序性指导与控制权限、用户同意和实时环境状态的执行条件捆绑在一起。当模型能力进步时,维护者会修剪在授权基准任务上显得冗余的指令。然而,授权维护测试可能让休眠的安全条件未被测试。这种错配在物理和隐私敏感效应上造成未测量的支持缺口。我们引入匹配权限反事实:在保持请求动作、工具参数和预期效果不变的同时,系统性变化单一治理谓词。我们通过双门退役证书形式化这一评测,要求候选削减在声明余量内保持授权效用,同时产生零次未授权的受保护效应。在覆盖四个前沿和本地模型配置、十二个技能包(2,592个评测单元)的受控实验中,经任务认证的削减移除了超过94%的技能条款并保持授权完成率,却在每个技能包中产生未授权的受保护效应。边界强制在声明的审计上消除了受保护效应,但对一个配置未能通过效用门。一个有界的组合协议在所有四个配置中通过双门,但效用余量为零。在一个只读Home Assistant摄像头链上的端到端检查验证了真实设备上的提案、决策和效果测量。这些结果表明,虽然任务基准可以为退役程序性指导提供依据,但退役决策需要显式审计治理物理行动的权限契约。

物理智能体的安全技能退役:论文配图
图 1:仅测试已授权动作时,可能在没有触发休眠同意规则的情况下就认可一次降低。匹配审计在保持相机动作不变的前提下翻转同意状态,然后分别记录提议、可信汇点(trusted-sink)决策与观察到的效果。