论文
聚合分数遗漏了什么:测量商业 LLM API 迁移中的项目级回归
What Aggregate Scores Miss: Measuring Item-Level Regressions in Commercial LLM API Migrations
摘要
上下文:当供应商弃用旧模型时,依赖于商业 大语言模型 API 的软件系统必须迁移到后续版本。迁移决策通常依赖于聚合基准分数,它将异构项目级行为压缩为单个净值。目标:我们测量压缩隐藏的内容。方法:在 GPT-5.4 到 GPT-5.6 Sol 产品序列中的三对升级中,我们对 900 个公共基准项目(研究生水平知识、奥林匹克数学、指令遵循)每个模型每个项目 50 次进行查询,将每个项目在错误发现率控制和实际意义阈值下分类为可靠改进、可靠回归、实际上等效或不确定,并根据标签排列零值校准结果。结果:在所有九个迁移基准单元中,可靠的改进和可靠的回归并存。总收益高达 7.3 个百分点的边缘包含高达 8.3% 的可靠回归项目;具有总损失的边包含高达 10.7% 的可靠改进项目。在指令遵循基准上,严格评分和宽松评分之间的差距在最新迁移中扩大了 3.9 个百分点:严格评分下的 3.9 分回归缩小到宽松评分下的 0.04 分。结论:仅基于总分的迁移决策错过了实质性的双向项目级别变化。完整的响应级别存档和每个项目的评分输出均已发布。