论文
物理智能体的安全技能退役
Safe Skill Retirement for Physical Agents
摘要
智能体技能把程序性指导与控制权限、用户同意和实时环境状态的执行条件捆绑在一起。当模型能力进步时,维护者会修剪在授权基准任务上显得冗余的指令。然而,授权维护测试可能让休眠的安全条件未被测试。这种错配在物理和隐私敏感效应上造成未测量的支持缺口。我们引入匹配权限反事实:在保持请求动作、工具参数和预期效果不变的同时,系统性变化单一治理谓词。我们通过双门退役证书形式化这一评测,要求候选削减在声明余量内保持授权效用,同时产生零次未授权的受保护效应。在覆盖四个前沿和本地模型配置、十二个技能包(2,592个评测单元)的受控实验中,经任务认证的削减移除了超过94%的技能条款并保持授权完成率,却在每个技能包中产生未授权的受保护效应。边界强制在声明的审计上消除了受保护效应,但对一个配置未能通过效用门。一个有界的组合协议在所有四个配置中通过双门,但效用余量为零。在一个只读Home Assistant摄像头链上的端到端检查验证了真实设备上的提案、决策和效果测量。这些结果表明,虽然任务基准可以为退役程序性指导提供依据,但退役决策需要显式审计治理物理行动的权限契约。
