论文
自动策略而非自动技能:面向物理世界的编译型Agent技能
Auto-Policy, not Auto-Skill: Compiled Agent Skills for the Physical World
摘要
自演化技能框架(AutoSkills、Hermes Agent)自动生成更多建议性编排;它们报告的收益是效率而非安全。这错过了真正的缺口:Skill描述智能体应如何行为;Policy决定哪种行为被允许成为动作。当今的技能格式用markdown和脚本覆盖前者,而后者交给了模型。生成更多技能只会扩大缺口而非增加安全,尤其当一次错误调用可以开门或移动资金时。两类相邻攻击已有记录:恶意技能攻陷云软件,以及被越狱的LLM控制机器人造成物理伤害。两者的交集——恶意智能体技能造成物理伤害——顺理成章但尚未被报道。我们将这一类命名为借权(Borrowed Authority):技能格式没有给接收智能体任何类型化的方式来拒绝智能体间的权限声明,因此恶意或被滥用的技能可以通过附加声明来驱动执行器。我们提出Edge Skillguard,一个类型化权限层,它位于技能工件内部而非像工作流引擎那样位于工具之间,并对世界状态和传感器证据设有守卫。在一个在线边缘控制面测试床上,守卫拒绝了五种攻击变体的60/60借权请求,且不阻断良性请求,该结果在5倍规模和跨Tailscale网格的主机上依然成立。这些结果表明,高风险技能应将类型化调用策略与过程性知识共同打包,使物理动作依赖机器可校验的证据而非对等智能体的声明。
