论文

幻影增益:以实测零基线审计自我改进

Phantom Gains: Auditing Self-Improvement Against a Measured Null

模型评测评测方法与指标

摘要

判断一个语言模型是否改进了自身,如今越来越多地不是看平均准确率,而是看它在哪些具体题目上得分、在哪些题目上失分。追踪这种逐题转换意味着对两个含噪估计作差,因而容易受测量伪影影响。我们对Qwen3-8B上三轮秩为32的LoRA自我训练进行审计,并以一个经过完全相同流程处理的冻结对照为参照,识别出七种测量失效,其中每一种在缺少对照时都会反转一项已报告的结论。有几种正是标准做法。基于单次贪心解码构建的账本会在一个未做任何训练的模型上制造出能力变化,这主要是推理批处理的伪影;区分“获取”与“锐化”的扩张统计量会给同一个模型算出0.280的扩张率。自然的阈值修补方案经不起重复:即使在该设计自身已包含的冻结比较上估计,其零基线仍然非零。我们改用在错误发现率控制下、针对合并基线的逐题精确检验,它在所有留出的重复样本上都检测不到任何信号,且在多重检验规则、错误率和基线池规模变化下保持不变。将该方法应用于在数据流、数据量与评估方式上相互匹配的阶梯式各臂后,审计发现外部蒸馏能改进基座模型很少能解出的题目,而三种形式的自我训练都不能;一项回归否定了“这种不对称只是蒸馏总体增益更大的副产品”的解释(p < 10⁻⁸)。在基座模型从未解出的规模小得多的题目集合上,证据尚无定论,而自我训练破坏基线阶段已解出题目的比例远高于实测底线。因此,转换层级的审计要求为其报告的每一条统计量单独实测零基线:这样的零基线无需新实验,可由多臂研究本已拥有的基线重复样本构建,但仅凭多数研究现有的少量重复样本还不够。

幻影增益:以实测零基线审计自我改进:论文配图
图6:迁移矩阵:问题实际向何处移动。三种难度带分支中,每道题在演化前后解题率的联合分布,按五分位分箱;虚线表示无变化,单元格计数总和为1,163。“上升”和“下降”分别统计对角线之上和对角线之下的题目数。每个分支在两个方向上都有大幅移动,这正是平均准确率无法表达的要点。