论文
随机差距:智能体AI中部署前可靠性和监督成本审计的马尔可夫框架
The Stochastic Gap: A Markovian Framework for Pre-Deployment Reliability and Oversight-Cost Auditing in Agentic Artificial Intelligence
摘要
组织中的智能体AI(AI)是一个受可靠性和监督成本约束的顺序决策问题。当确定性工作流程被针对操作和工具调用的随机策略所取代时,关键问题不在于下一步是否看似合理,而在于所得到的轨迹是否仍保持统计支持、局部明确且经济上可治理。我们为此设置开发了一个测度理论马尔可夫框架。核心量是状态盲点质量 B_n(tau)、状态动作盲点质量 B^SA_{pi,n}(tau)、基于熵的人机循环升级门以及工作流访问度量的预期监督成本恒等式。我们在 2019 年业务流程智能挑战赛购买到付款日志(251,734 个案例、1,595,923 个事件、42 个不同的工作流操作)上实例化该框架,并根据同一流程的时间顺序 80/20 分割构建一个日志驱动的模拟代理。主要的实证发现是,大型工作流程可以在状态级别得到很好的支持,同时在下一步决策中保留大量的盲目质量:细化操作状态以包括案例背景、经济规模和参与者类别,将状态空间从 42 扩展到 668,并将状态-动作盲目质量从 tau=50 时的 0.0165 提高到 tau=1000 时的 0.1253。在保留的分割中,m(s) = max_a pi-hat(a|s) 轨道实现了平均 3.4 个百分点的自主步进精度。界定统计上可信的自治权的数量也决定了预期的监督负担。该框架在大型企业采购工作流程中进行了演示,旨在直接应用于可获取操作事件日志的工程流程。