论文
生产环境中的高效基准测试:对一个持续演进的LLM Agent的研究
Efficient Benchmarking in Production: A Study of an Evolving LLM Agent
摘要
生产级LLM Agent随演进被反复评估,但完整Agent基准的重跑成本高昂。我们针对一个服务数万月活用户的生产分析Agent研究高效的周期性评估,并报告第一手的部署经验。利用生产基准的574次历史运行,按时间顺序划分为校准期与留存期,我们比较了随机抽样、历史缓存、固定代表性子集与基于IRT的自适应测试。结果显示,多维2PL自适应测试取得最佳的整体分数保真度:执行200题(完整运行的38.5%)即可达到1.03个百分点的MAE。然而出于运维简便性,我们最终部署了按难度分层的固定子集,并证明其无需重新校准即可迁移到另外五个Agent家族,且在短至一天的校准窗口内保持稳定。基于这一部署经验,我们给出生产Agent周期性评估的实用建议。
