论文

成功并非不证自明:智能体评估中的成功来源审计

Success Is Not Self-Explanatory: Auditing Success Provenance in Agent Evaluation

智能体系统Agent任务评测

摘要

正确答案可能掩盖智能体成功的原因。一旦智能体在评估过程中改变了自身的信息状态,正确性就不再能区分按预期推理与获取到答案。结果证据与暴露检测都无法确立成功是否依赖于所获取的目标;我们将这一缺失的评估对象称为成功来源(success provenance)。AcquaBench通过在四个标准化面上进行匹配的CLEAN、GOLD与SHAM值替换并辅以联合qid聚类分析来审计它。CLEAN保留基准授权的信息。GOLD使正确目标可用。SHAM保留来源结构与暴露机会,但替换为一个匹配的错误值。GOLD减CLEAN衡量分数对正确目标可用性的总体响应;GOLD减SHAM检验该响应是否在匹配的来源暴露之外仍追踪目标正确性。在D0中,GOLD比SHAM高19.1至25.9个百分点,表明成功跟随正确值。在D2中,分布式充分性下GOLD仍高于SHAM,而coloc不再能作为高分标记迁移,AUROC分别为0.376和0.142。因此,行为依赖可以持续存在于该探针预期观测单元之外。在模型比较中,一个有依据的5.0分CLEAN分差压缩为-0.6分的原始GOLD差值,但这并不足以确立排名倒置。智能体基准应在报告成功的同时,报告所评估的信息状态是否支持了这一成功。