论文
受监督的 微调 何时会降低指令灵敏度?
When Does Supervised Fine-Tuning Reduce Instruction Sensitivity?
摘要
大语言模型 可以在同一任务指令的替代公式中表现出巨大的性能差异,但目前尚不清楚传统的任务特定监督 微调 (SFT) 如何改变这种指令的敏感性。我们通过评估多个释义指令下的固定模型检查点并将指令敏感性定义为它们之间的任务性能的标准差来研究这个问题。我们在 MS MARCO 上使用 1.7B、4B 和 8B 的 Qwen3 模型进行受控规模分析,并使用 Mistral-7B 和 Gemma-2-9B 进行有针对性的跨家族检查。在 SFT 之前,Qwen3 模型规模的指令灵敏度急剧下降。在 1.7B 和 4B 时,SFT 持续降低整个训练指令的灵敏度,降低幅度约为 54--71%。在 8B 处,个体敏感性变化在统计上无法与零区分,但训练指令之间的配对对比在查询级引导分析下在统计上是可靠的,并且在所有三个随机种子中具有一致的方向。 Gemma-2-9B 显示出与 Qwen3-8B 相同的定向训练指令对比度,而 Mistral-7B 则不然,这表明这种效应的强度在不同模型中也存在差异。 ESCI-English 的实验进一步表明,即使有效标签生成接近完美并且平均任务表现相似,自由生成和基于可能性的强制选择评估也可以产生不同质的鲁棒性结论。总体而言,SFT 并不会一致地降低指令灵敏度:其鲁棒性效果取决于自适应设置,而测量的灵敏度还可能取决于预测和评分协议。