论文

Agent 评测的独立信任层

A Trust Layer for Agent Evaluation

智能体系统Agent任务评测

摘要

确定性基准分数显示智能体获得了信用,但不知道该信用是否已获得、如实报告或是否会在第二次运行中保留。我们为智能体评估引入了信任层,这是一个附加的事后框架,除了每个记录的分数之外,还报告是否应该相信它。它验证四个属性:结果是否受到基准测试自身评分逻辑的支持、通过的答案是否是通过可追踪计算获得的、智能体的完成声明是否与发生的情况匹配、以及结果在重复执行下是否稳定。前三个仅使用保存的工件;第四个重新运行智能体。示范判决仅在多数表决下标记证据;所有的判决都遵循确定性规则,并且永远不会修改记录的分数。应用于智能体上次考试中 108 项任务的 5 种智能体配置中,每个模型都显示通过运行,但没有可追踪的计算(速度变化十倍)、确认的错误完成声明和不稳定的结果:18-46% 的任务在五次运行中不会停留在一个分数范围内。只有 22.6% 的记录通过了所有四项检查(95% CI 15.0-32.6,n=84)。测量智能体的功能和验证它是否做到了是不同的问题,当前的基准测试仅解决第一个问题。