BRaVeS:为Agentic自动化建立有界自治与可验证安全
Bounded Autonomy and Verifiable Safety for Agentic AI Enabled Automation
摘要
Agentic AI-enabled automation cannot be safely deployed in high-stakes environments on probabilistic reasoning alone.一个反复出现的风险是认知漂移:随着推理的深入,系统行为可能会脱离主题专家的安全操作约束。本文提出了 BRaVeS,一种称为可防御下一代推理系统 (DNRS) 的有限推理和安全治理框架。 BRaVeS 将 SME 定义的约束编码为不变锚点,提出 MoDA 式(深度注意力混合)深度感知访问作为在推理过程中保持这些锚点可见的候选机制,并使用状态层次结构 (SMARTAutonomy) 在认知风险增加时减少自主性。为了形式化有界恢复,我们引入了李亚普诺夫有界共识框架(LBCF),它将连续的认知风险信号映射到有限的 K-bag 抽象中,并应用屏蔽状态转换来强制李亚普诺夫式能量下降或将系统路由到人类介导的终端状态。 The formal convergence result applies to the finite LBCF abstraction under fixed thresholds and feasible-shield assumptions; it does not prove safety of the full continuous neural activation space.我们使用具有合成噪声和传感器退化机制的 HAI 22.04 工业控制系统时间序列数据,通过离散事件蒙特卡罗模拟来评估该框架。在测试的参数分组策略和阈值中,LBCF 过程实现了有限步收敛并且没有安全防护违规。这些结果提供了基于模拟的证据,表明可以在规定的抽象下强制执行有界治理行为,同时激励未来在部署的Transformer实现、实时人机循环验证和更广泛的对抗性设置方面的工作。