论文
最后一道人类关卡:面向治理自动化的前置部署工程
The Last Human Gate: Forward Deployed Engineering for Governance Automation
摘要
企业治理需要决策、证据和可问责的权威,但并不要求每项审查任务都保持当前的人工实现。我们为数字治理框架(DGF)开发了一个任务替代框架,把每个关卡视为可执行契约。替代需要充分的可访问信息、有效的决策与权限检查,以及在计入异常、验证、纠正和维护之后总人工工作量的减少。我们推导出剩余工作量阈值,并说明为何自动化大多数情况仍可能增加劳动量。前置部署工程把这些条件与由智能体、规则引擎、证据服务和升级机制构成的架构联系起来。DGF-Bench从300个合成项目和899次可评测的模型-项目运行中提供受控证据。Gemini 3.8 Flash、GPT-5.6 Luna和DeepSeek v4.1 Flash的严格关卡成功率分别为94.98%、83.29%和74.18%;完整路由成功率为76.92%、42.33%和24.67%。确定性控制在给定规则和结构化事实的情况下通过了全部1,700个关卡,把比较定位于执行给定决策内核上。证据审计和135次重复运行区分了正确决策与可靠执行。一个文档反例确立了信息充分性障碍。这些结果支持用智能体和软件替代特定治理审查任务的人工执行在技术上的可行性。该框架规定了基于固定输出和质量下所需完整人力的劳动力测试;本文的测量针对审查性能。源代码、卷宗、轨迹和分析均已公开。
