论文
智能体基准能否支撑其分数?交互式智能体评估的证据支撑边界
Can Agent Benchmarks Support Their Scores? Evidence-Supported Bounds for Interactive-Agent Evaluation
摘要
交互式智能体基准通过结果检查(outcome check)将一次智能体运行映射为二元结果。当这些检查依赖表层信号或未能捕捉智能体的实际动作路径时,它们无法可靠地判定运行是否成功。例如,基准任务可能询问Alice的收货地址是否被更改,而结果检查只验证智能体是否点击了"Save"。这并不能保证预期的状态变更确实发生,因为智能体可能修改了错误的记录。因此,将这样的运行视为成功会使报告的分数具有误导性。基准质量因而不仅取决于任务设计,还取决于结果检测的可靠性。我们通过为现有基准引入一个结果证据报告层来解决这一问题,且不修改其任务、智能体或评估器。该层执行三项功能。首先,在打分之前,它为每个案例指定验证所声称结果需要哪些已存储的产物。其次,它对每次已完成的运行应用一份锁定的检查清单,并赋予三种证据标签之一:Evidence Pass、Evidence Fail或Unknown。第三,它报告证据支撑的分数边界,量化由Unknown案例带来的不确定性。该框架并非在单一聚合成功率中默默统计、丢弃或隐藏不确定案例,而是使其保持明确可见。我们在五个公开基准上评估结果证据层:ANDROIDWORLD、AGENTDOJO、APPWORLD、tau3 bench retail与MINIWOB。所得报告区分出若干经验上可分辨的失败模式。
