论文
EIO-Agents:Agent 评测缺失的语义层
EIO-Agents: The Missing Semantic Layer for AI Agent Evaluation
摘要
AI 智能体正在日益重要的环境中进入生产环境,但其评估的实际含义却没有共享的语义标准。分数、痕迹、法官输出和多陪审团调查结果越来越多地用于证明准备和释放决定的合理性,但它们通常没有具体说明哪些证据支持主张、证据可以证实什么,或者主张如何导致决定。我们推出 EIO-智能体,这是一种基于两层的可互操作 AI 智能体评估的开放规范。评估智能本体 (EIO) 通过类型化证据、版本化行为谓词、证据合同、声明、证人规则、证明状态、重复性以及指标、发现、控制和通过、审核或阻止决策的可计算推导提供语义层。可移植评估记录 (PER) 提供了记录系统:一个评估的规范的、内容寻址的表示,它保留了决策链的证据,并且可以重新导出、解释和验证。分数总结、陪审团解释、痕迹记录,但它们都没有定义证据的含义或可以证明什么。 EIO 提供了缺失的语义契约,而 PER 将结果评估保留为可移植且可验证的记录系统。随着AI 智能体承担更大的运营责任,评估必须不仅仅是分数和判决的集合;它必须成为一个负责任的工件,其意义、证据、局限性和决策都可以被独立检查。
