论文
面向模型能力提升的数据与评估闭环
Data and Evaluation Closed-Loop for Model Capability Enhancement
摘要
模型能力是LLM预训练的中心变量——但从不被直接观察:数据前瞻性地塑造它——评估只回溯性地揭示它——把样本、提示、解码与评分规则压缩成一个带噪分数。实际优化反向运行:先观察到失败——工程师必须推断语料修复。两侧说着不兼容的词汇——基准名与逐样本正确性对比数据来源、领域与质量标签——因此该推断通常靠直觉而非方法。我们以能力切片闭合该缺口:共享背景条件、任务类型、求解操作与输出约束的一组评估样本——足够精确定位单一弱点——又足够稳定以在聚合后存续——不像基准名太粗、单样本太噪。围绕该单元——评估分类法、非指令数据分类法与映射规则形成闭环——把基准级失败转为定向、可检验的数据干预。我们在两个方向相反的案例上检验该闭环。第一——闭环否决数据:继续预训练使BBH下降46.82%——但诊断追溯到一个被掩码的<EOS>损失而非推理弱化;恢复它使BBH回到66.44、高于原检查点——不改任何数据。第二——闭环采纳数据:持续存在的数学推理弱点被按求解操作分解为具体失败组合——由其构建的弱点定向采样程序把AIME2025/AIME2026 Pass@128从6.67/0.00各提升到26.67。同一未修改的闭环在两案例中给出相反且正确的裁决——表明评估到数据的推断可以是例行的、可审计的、经实验验证的——而非直觉。
