论文

从提案到验证效果:Praxa,用于受控 AI Agent执行的证据绑定工具

From Proposal to Verified Effect: Praxa, an Evidence-Bound Harness for Governed AI Agent Execution

智能体系统Agent 动作执行与治理Agent Harness

摘要

大语言模型智能体可以提出并执行行动,但提案、授权、调度、验证外部效果和服务推广是不同的说法。我们提出了 Praxa,这是一种Agent工具,它通过确定性准入、Agent执行、外部回读、协调和审查提升来明确代表这些状态。我们报告了四个证据通道。首先,作者在固定修订版上运行的存储库本地审计通过了 1,027/1,027 个单元测试和 89/89 个 Workerd 测试,检测了所有 363 个预期源文件,并满足了四个覆盖范围;原始的每次测试成绩单和独立复制不可用。其次,在提供商支持的 Terminal-Bench Core 0.1.1 试点中,涉及 12 个策划任务,基线和可靠性层臂均通过了 17/36 的严格试验。可靠性层使用了 37.49% 的输入和 50.73% 的输出词元,因此该试点不支持优越性。第三,在调试后、二阶协调Agent开发比较中,基线和源编写的候选者各自完成了 180/180 次试验,具有相同的测量精度、完全密封的崩溃恢复和零受保护违规。候选人使用的词元减少了 37.11%,估计端点成本降低了 33.84%,步骤减少了 11.63%;这并不能改善质量、延迟或生产行为。第四,部署的源/配置证据显示有限的反射、召回核算、内存编译和工具健康路径,但没有生产成果提升。 Praxa 的支持贡献是一个有证据支持的架构,它使权威到效果的转换变得明确且可测试。目前的证据并未建立对抗性安全、生产安全、一般专家优势、自主递归优化或用户利益。