论文

追踪能力以实现更安全的智能体

Tracking Capabilities for Safer Agents

智能体系统Agent 动作执行与治理Agent Harness

摘要

通过工具调用与真实世界交互的AI智能体带来根本性的安全挑战:智能体可能泄露隐私信息、造成意外副作用,或被提示注入操纵。为应对这些挑战,我们提出把智能体置于基于编程语言的“安全挽具”中:智能体不直接调用工具,而是以能力安全语言——带捕获检查的Scala 3——把意图表达为代码。能力(capability)是调控对相关效果与资源访问的程序变量。Scala的类型系统静态追踪能力,对智能体能做什么提供细粒度控制。特别地,它支持局部纯性,即强制子计算无副作用,防止智能体处理机密数据时的信息泄露。我们证明可以利用带能力追踪的强类型系统构建可扩展的智能体安全挽具。我们的实验表明,智能体能够生成能力安全的代码且任务性能无显著损失,同时类型系统可靠地阻止信息泄露和恶意副作用等不安全行为。

追踪能力以实现更安全的智能体
图1:tacit 框架概览。AI 智能体通过 MCP 工具调用发送 Scala 代码。代码由带捕获检查(capture checking)的 Scala 3 编译器验证并编译,然后在 REPL 中执行。能力安全库(capability safety library)是与真实世界(文件、进程、网络、子智能体)所有交互的网关。