论文

AutoTuneBench:让Agent自动调优推理引擎的测量可信

AutoTuneBench: Trustworthy Measurement for Agent Auto-Tuning of LLM Serving Engines

智能体系统Agent任务评测

摘要

大语言模型智能体通过“提出方案、测量、保留”的闭环调优GPU内核与服务引擎,但该闭环背后的测量并不可信。我们从为期四天、包含619次模型调用的试点语料中归纳出四种失败模式:稻草人基线制造提速,绝对耗时无法跨机器迁移,任务饱和使比较失效,基础设施缺陷伪装成科学发现。我们提出AutoTuneBench,一套将可信性落实到架构中的基准和测量协议。协议以代码冻结,并通过测试强制保证来源可追溯;数据库级校验器拒绝不符合协议的结果;防作弊检查位于智能体可修改范围之外;对比采用预注册的观测指标;测量以外部已发表结果为锚点,采用配对随机种子统计,并将跨运行变异系数上限设为5%。诚实测量改变了显著结果的表述:我们最好的内核相对朴素基线为10.6倍,相对合理基线仅为2.03倍;某一配置在一台机器上为1.174倍,在另一台上为1.0049倍;预注册的开关对比在共同瓶颈处显示无效(2.4840对2.4957毫秒);KernelBench Level-1套件中51%的任务满足接纳条件,相对PyTorch eager的中位提速为1.0001倍。协议、包含vLLM与SGLang的双引擎语料和审计轨迹均作为开放产物发布。