论文

Harness即资产:通过收敛式AI智能体框架(CAAF)强制确定性

Harness as an Asset: Enforcing Determinism via the Convergent AI Agent Framework (CAAF)

智能体系统Agent Harness

摘要

大语言模型 (LLM) 在安全关键型工程中产生了可控性差距:即使未被检测到的约束违规发生率很低,也会导致系统无法部署。当前的编排范式遭受阿谀奉承、上下文注意力衰减 [Liu et al., 2024] 和自我纠正过程中的随机振荡 [Huang et al., 2024] 的困扰。我们引入了融合人工智能代理框架(CAAF),它通过三个支柱将代理工作流程从开环生成转变为闭环故障安全确定性:(1)具有物理上下文防火墙的递归原子分解; (2) 利用作为资产,将域不变量形式化为由确定性统一断言接口 (UAI) 强制执行的机器可读注册表; (3) 具有状态锁定的结构化语义梯度以实现单调收敛。跨两个领域的实证评估——SAE 3 级 (L3) 自动驾驶 (AD)(n=30,7 个条件)和制药连续流动反应器设计(n=20,4 个条件,包括 Mono+UAI 消融)——表明 CAAF-all-GPT-4o-mini 实现了 100% 悖论检测,而单片 GPT-4o 实现了 0%(即使在温度 = 0 时)。制药基准具有 7 个具有非线性阿伦尼乌斯相互作用的同时约束和一个 3 路最小不可满足子集,代表了比 2 约束 AD 悖论在结构上更难的挑战。替代的多代理架构(辩论、顺序检查)在 80 次试验中也实现了 0%,这证实了 CAAF 的可靠性源自其确定性 UAI,而不是来自多代理编排本身。 Mono+UAI 消融 (95%) 将 UAI 隔离为核心贡献。 CAAF 的可靠性对于提示提示是不变的;所有组件都使用单一商品模型,从而实现完全离线部署。