论文
可审计的智能体
Auditable Agents
摘要
LLM智能体调用工具、查询数据库、委派任务并触发外部副作用。一旦智能体系统能够在现实中行动,问题就不再仅仅是能否阻止有害行为——而是这些行为在部署后是否仍可被追问。我们区分问责性(确定合规并分配责任的能力)、可审计性(使问责成为可能的系统属性)与审计(从可信证据重建行为的过程)。我们的主张直截了当:没有可审计性,任何智能体系统都无法实现问责。为使其可操作,我们定义了智能体可审计性的五个维度,即动作可恢复性、生命周期覆盖、策略可核查性、责任归属和证据完整性,并识别出三类机制(检测、强制、恢复),它们在时间维度的信息与干预约束解释了为什么在实践中没有任何单一方法足以胜任。我们以分层证据而非单一基准来支持这一立场:下界生态系统测量表明,连可审计性的基本安全前提也普遍未被满足(六个知名开源项目中共617项安全发现);运行时可行性结果显示,带防篡改记录的执行前中介仅增加8.3 ms的中位开销;受控恢复实验表明,即使常规日志缺失,责任相关信息也可被部分恢复。我们为智能体系统提出可审计性卡片(Auditability Card),并识别出按机制类别组织的六个开放研究问题。
