论文

先思考再行动——面向自主AI智能体的神经认知治理模型

Think Before You Act -- A Neurocognitive Governance Model for Autonomous AI Agents

智能体系统Agent 动作执行与治理Agent Harness

摘要

自主AI智能体在企业、医疗保健和安全关键环境中的快速部署造成了根本性的治理缺口。现有方法——运行时护栏、训练时对齐和事后审计——将治理视为外部约束而非内化的行为准则,使智能体容易做出不安全且不可逆的行动。我们通过借鉴人类自然的自我治理方式来填补这一缺口:在行动之前,人类会调用以执行功能、抑制控制和内化组织规则为基础的审慎认知过程,评估某个意图中的行动是可允许的、需要修改的,还是需要上报的。本文提出一个神经认知治理框架,将这一人类自我治理过程形式化地映射到LLM驱动的智能体推理上,在人脑与作为智能体认知核心的大语言模型之间建立起结构性的对应。我们形式化了行动前治理推理循环(Pre-Action Governance Reasoning Loop,PAGRL),其中智能体在每个有重大影响的行动之前都要查阅四层治理规则集——全局层、工作流特定层、智能体特定层和情境层,这类似于人类组织在企业、部门和角色层级上构建合规层级的方式。在一个生产级零售供应链工作流上实现后,该框架达到95%的合规准确率和零次向人工监督的错误上报,表明将治理嵌入智能体推理比外部强制执行能产生更一致、可解释且可审计的合规性。这项工作为自主AI智能体提供了像人类一样自我治理的原则性基础:不是因为规则被强加于它们,而是因为审慎思考已嵌入其思维方式之中。

先思考再行动——面向自主AI智能体的神经认知治理模型:论文配图
图1:人类与AI智能体均通过自然语言提示与大语言模型交互,这一相似性构成本文人类-智能体治理类比的基础。