论文
重审自学:从自生成QA学习的隐藏脆弱性
Self-Study Reconsidered: The Hidden Fragility of Learning from Self-Generated QA
摘要
语言模型越来越多地通过综合问答(QA)监督来教授:模型生成有关文档的问题,从同一文本中回答这些问题,所得的对用于微调、提炼或压缩知识到另一个模型中。我们证明这个生成步骤不是中性预处理。这是一个隐含的策略,既选择哪些证据成为训练信号,又决定如何回答该证据,并且在这两个阶段都是脆弱的。在选择询问内容时,生成器不会统一扫描文档。覆盖范围很早就饱和并集中在显着的跨度上,不同的提示集中在同一区域,而看起来值得质疑的内容是由本地呈现驱动的。因此,诸如清理不善的标记之类的显着工件可能会劫持跨模型系列和规模的问题生成。在回答时,产生监督的模型倾向于遵循文本中嵌入的类似指令的段落。这种遵从性取决于段落的意图和表面形式,而不是其严格性,并且在任务冲突下最差,其中较大的模型更经常遵从。这些故障模式是由 QA 生成过程中做出的选择引起的,因此可以在不改变训练循环的情况下减少它们。将每个问题与固定目标联系起来可以减少有偏见的选择,并且在回答之前过滤类似指令的跨度可以将我们评估中的平均注入合规性从 $88\%$ 降低到 $13\%$,同时保留几乎所有干净的文本。
