论文
智能体基准决策需要多少任务:公开LLM智能体基准的重放分析
How Many Tasks Are Enough for Agent Benchmark Decisions? A Replay Analysis of Public LLM Agent Benchmarks
摘要
智能体基准常在全部任务跑完后比较两个智能体,但高昂的评估成本使部分运行诱人。仅凭任务比例不能说明部分运行是否支持与完整基准相同的成对结论。我们以重放SWE-bench、AppWorld与tau-bench已完成的公开任务级记录研究该问题。部分预算算足够,仅当它支持完整基准的决策、覆盖所需任务组、且未解决的比较不超过目标比例。所需任务比例变化剧烈:在5个百分点预算网格的严格0分差阈值下,AppWorld在15%首次满足全部目标,tau-bench在25%,SWE-bench Verified在90%;SWE-bench Lite在主覆盖规则下到95%仍未满足全部目标。部分评估报告应说明:一个智能体必须胜过另一个多少、任务如何选取、要求什么覆盖规则、使用什么决策规则、多少比较可以保持未决。
