论文

词元分配与数据量:多域会议摘要中的域平衡

Token Distribution versus Data Volume: Domain Balancing in Multi-Domain Meeting Summarisation

模型训练监督微调与指令调优

摘要

微调 和 LLM 共同研究了大小差异很大的会议总结语料库,提出了一个先前工作令人困惑的问题:当域平衡训练混合物有所帮助时,增益是由于跨域的词元分布,还是仅仅由于所看到的数据量?我们通过在五个英语会议语料库、微调 Mistral-7B 和 QLoRA 上匹配的 词元预算 (2-32M) 上构建平衡和自然(原生比例)的词元混合物来理清这些因素,并对每个域进行评估。平衡重新分配质量,以低成本改善数据稀缺的少数领域到数据丰富的领域。只要少数领域很重要,行业就会倾向于平衡:无论预算如何,它们在比例分配下的份额都固定在 1-2%,因此在这些领域上匹配平衡的质量需要更多的总数据。我们进一步发现,修剪低价值转录行可以在没有可测量成本的情况下从会话语料库中删除约 15% 的标记,并且通过标记进行平衡与通过示例进行平衡不同。 微调 每个域一个模型仅在数据丰富的域上具有竞争力,并且在数据稀缺的域上低于零样本模型。对 741 个法官标记的事实进行的两名注释者研究验证了我们的事实级别评估。这些结果共同为实践者提供了决定何时平衡不平衡的多域混合以及在什么单元上平衡的基础。