论文

诊断 微调 数据中的能力差距

Diagnosing Capability Gaps in Fine-Tuning Data

AI 基础设施数据基础设施

摘要

用于特定领域任务的 微调 大语言模型 (LLM) 需要全面涵盖从业者所需的目标能力的训练数据集。然而,确定数据集无法支持哪些功能,并在昂贵的 微调 运行之前这样做,仍然是一个很大程度上尚未解决的问题。我们引入了 GoalCover,这是一个框架,可帮助从业者通过交互式目标分解和自动覆盖率评估系统地检测 微调 数据集中的能力差距。 GoalCover 指导实践者将高级目标结构化分解为原子的、可独立评估的子目标;针对每个子目标为每个训练样本分配一个基于 LLM 的对齐分数;并通过对低分样本解释的自动分析来发现缺失的功能。我们沿着两个互补的轴验证框架。首先,通过跨三个领域(医学 QA、法律摘要、代码生成)的受控腐败实验,我们表明 GoalCover 可靠地区分了目标能力影响和非目标能力影响:目标子目标平均下降 25.6%,而非目标子目标平均下降 2.1%(Cohen's d=1.24)。其次,我们展示了使用 Qwen-3-14B 进行财务汇总强化 微调 (RFT) 任务的下游效用:对 GoalCover 过滤数据进行训练,将 LLM 判断奖励从未过滤基线的 3.77 提高到 4.12(满分 5),并将过滤数据与目标条件合成样本相结合产生最强结果 (4.20)。这两个结果共同表明,GoalCover 可作为 微调 之前的实用诊断工具:它检测能力差距并产生用于弥补能力差距的具体信号。