论文

Agent是系统,而不是模型:重新思考 Agentic 评估

Agents Are Systems, Not Models: Rethinking Agentic Evaluation

智能体系统Agent任务评测长程任务评测

摘要

Agent评估越来越超越单一的成功率,报告成本、一致性和鲁棒性等指标。然而他们通常将Agent本身视为固定的。在实践中,Agent是一个可配置的系统:用户决定告诉它什么,让它运行多长时间,以及使用哪个模型,并且每个选择都可以改变它的执行效果和一致性。我们在四个科学任务的新基准上研究这些选择,其中编码Agent必须找到并正确操作已发布的专业模型。我们研究了Agent配置的五个部分:任务信息、推理、自我验证、时间预算和骨干模型。我们发现运行之间存在很大的差异,大约 54% 的结果差异来自于重复相同的配置而不是更改它。在各种配置中,提供给Agent的信息具有最大的影响,超出了时间预算和模型大小,同时还降低了成本并改进了校准。配置选择也会相互作用:只有当Agent拥有足够的信息或足够强大的模型来使用它时,额外的时间才有帮助。最后,基于轨迹的Agent行为分类表明,提示Agent验证其答案对其验证行为影响不大,而提供专用验证工具会大大改变该行为。这些结果表明,Agent应该被评估为可配置系统本身,并且一些期望的行为在系统中比通过提示请求更有效地实现。我们发布了基准测试和超过 18,000 个Agent轨迹。