论文

CRAFT:用聚类评分准则诊断LLM弱能力并生成定向微调数据

CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data

模型评测评测方法与指标

摘要

评估不应只衡量模型当前表现,还应告诉我们下一次迭代要修什么,并提供生成定向后训练数据的方法。多数评估流程只定位薄弱样例、主题或类别,却把底层能力缺陷留在隐含层面:它们说明模型在哪里失败,而不说明为何失败。我们提出CRAFT,把任何基于评分准则的评估数据集转换为模型特定的弱能力诊断。CRAFT把每条评分准则视为能力探针:从每个提示—准则对中抽取能力描述,把这些描述聚类为层级能力树,在树的每个节点为模型打分,并在各层级间动态选择低分节点——在每个失败最清晰的粒度上定位。被选出的弱能力进而指导定向监督微调数据的生成。在固定数据生成、微调与评估设置下,我们在四个开源模型、两个专业领域(金融与法律)、13个与诊断数据不相交的留出基准上,把CRAFT与提示级EvalTree聚类及非定向随机生成比较。在重复温度解码下,CRAFT在全部四个模型上取得最强的金融领域平均;在法律领域,四个模型中三个最强,第四个保持在最佳基线的解码方差带内。在评分准则层面而非提示或类别层面诊断弱点,既能更清晰地刻画模型不能做什么,也能让按诊断微调后的模型可度量地更好。