论文

CurveShift:智能体进度是标量吗?将级别与形状分离

CurveShift: Is Agent Progress Scalar? Separating Level from Shape

模型评测模型能力评测

摘要

大语言模型 中的进展通常使用单个标量度量进行总结,例如时间范围、潜在能力估计或总体基准分数。这些摘要反映了整体表现,但它们并没有测试进度是否在任务难度上分布不同。我们发现,大多数明显的收益转向更困难的任务并没有反映出难度反应曲线形状的变化。在 METR 时间范围数据上,能力上升的单个 Rasch 模型再现了这种模式,因此这在很大程度上是由天花板效应而不是能力的质变来解释的。这与度量的选择如何使所声称的新兴能力看起来像是模型本身的属性相呼应。然后,我们确定了在这种控制下仍然存在的较小的困难任务效应。在代理基准上隔离它很困难,因为较新的模型通常使用较新的代理工具运行,因此困难任务的收益不能分配给模型或其支架。我们通过 LiveCodeBench 打破了这种混乱,LiveCodeBench 是一个公共竞争性编程基准,它不运行代理支架,同时将过时的模型与外源难度排序配对。考虑到整体能力的提升后,2024 年 9 月后发布的模型在最难问题上的表现仍然超出了其简单和中等性能的预测,在我们最保守的假设下,增加了约 +0.40 logits,将难问题解决率从大约 18% 提高到 25%。这种效应是由最强大的推理模型主导的,并且适用于只需要简短推理而不是长期自主的艰巨任务。我们将此作为特定于竞争性编程的结果,因为我们的清晰识别依赖于单一编码基准。我们发布了 LiveCodeBench 难度面板(66 个过时模型 x 1,055 个问题)和我们的分析代码。