论文

可达不等于实现:追踪LLM基准增益的来源

Reachability Is Not Realization: Tracing the Sources of LLM Benchmark Gains

模型评测模型训练强化学习评测方法与指标RLVR

摘要

基准得分往往被视为LLM能力的证据。然而,相同的增益可能反映不同模型行为的变化。一个模型可以达到新的答案,或者产生已经在范围内但尚未被发现的答案。汇总分数无法区分这些问题中的变化。我们建立了一个基于固定预算、温度和答案格式的问题级审计。问题是在默认部署过程中生成正确的答案时实现的。问题是在指定探针中找到答案的情况下可到达的。我们在一个匹配的预算下,随机路由与结构化搜索在所有43个模型和任务设置中都达到相同的水平。盲目的方法几乎保留不了这个增益,而需要访问到正确的答案。然后我们询问为什么可到达的答案有时无法出现。在跨越0.5B到31B的六个案例中,关闭一个识别出的MLP块修复了预定义失败集中的68%到92%。然后我们测试训练是否通过扩展可达性来缩小差距。在五个六次匹配评估中,部署性能上升而可到达的天花板保持不变或下降。对于DAPO,部署分数上升14.7点,而可到达的天花板下降13.3点。因此,在审计的所有设置下,实现和可达性并不总是同时变化。能力扩展的声称应该在匹配的评估条件下报告已实现的性能和可达性。代码可在https://github.com/LiZaiyuan0619/reachability-not-realization找到。