论文

AI Harness:基础模型Agent提案条件信息下的认证

AI Harness: Certification under Proposal-Conditioned Information for Foundation-Model Agents

智能体系统Agent 动作执行与治理Agent Harness

摘要

基础模型Agent通常被建模为针对观察状态的策略。然而,在已部署的系统中,只有在模型发出语义建议后,运行时才可能进行干预,使建议既成为动作候选者,又成为由历史条件过程生成的决策时观察。我们证明,将这种结构折叠成仅包含状态的提案信封可以保留提案覆盖范围,同时破坏可证明性。在有限鲁棒接口中,折叠模型的可行性内核包含在历史增强内核的物理投影中,并且当每个提案条件的折叠纤维保留共同的鲁棒安全干预时,折叠是无损的。即使提案和历史字母表大小恒定,这种差距也可能是最大的。相同的共同行动条件产生双重结果:当它分离需要不相容干预的潜在模式时,观察当前的提议可以恢复稳健的可行性。我们使用精确的有限信念和标准安全性和可达性固定点随着时间的推移扩展这些一步结果,将不确定的操作可行性与有限的最坏情况验证进展分开。当遥测或效果验证被删除或干预权限受到限制时,受控模型在环测试会重现预测的障碍。因此,我们的贡献不是新的定点微积分,而是描述何时需要提案(模型的历史相关性)工具边界的认证。

AI Harness:基础模型Agent提案条件信息下的认证:图1:核心机制。以历史为条件的提议上下文分别允许安全干预(左);保持覆盖可靠性的仅状态压缩可能合并它们,消除共同的鲁棒安全干预(中,定理1)。观测当前提议可细化合并后的决策上下文,恢复鲁棒可行性(右,定理2)。
图1:核心机制。以历史为条件的提议上下文分别允许安全干预(左);保持覆盖可靠性的仅状态压缩可能合并它们,消除共同的鲁棒安全干预(中,定理1)。观测当前提议可细化合并后的决策上下文,恢复鲁棒可行性(右,定理2)。