论文

通过答案分歧选择指令数据

Instruction Data Selection via Answer Divergence

模型训练合成数据

摘要

指令调整依赖于大型指令响应语料库,其质量和组成强烈影响下游性能。我们提出答案分歧引导选择(ADG),它根据多样本输出的几何结构选择指令数据。 ADG 每条指令绘制几个高温代,将响应映射到嵌入空间,并计算联合编码色散幅度和形状各向异性的输出散度分数。高分对应于答案相距较远且多模态的指令,而不是沿着单一方向聚集的释义。在两个骨干网和三个公共指令池中,微调 仅在 10K ADG 选择的示例上在推理、知识和编码等六个基准上始终优于强选择器。分析进一步表明,色散幅度和形状各向异性都是必要的,支持答案分歧作为指令数据选择的实用信号。代码和附录包含在补充材料中。