论文
EmbGen:使用重组语料库进行教学
EmbGen: Teaching with Reassembled Corpora
摘要
将小型指令调整模型适应专门领域通常依赖于精选指令响应示例上的监督 微调 (SFT),而大规模收集这些模型的成本很高。教师 LLM 从领域语料库生成的综合训练示例可以降低此成本,但现有管道可以产生同质化输出,并且不能一致地捕获跨段落或跨文档依赖性。我们引入了 EmbGen,这是一种合成数据生成管道,它将语料库分解为实体描述对,使用从嵌入相似性推断出的语义结构重新组装它们,然后通过邻近、集群内和集群间采样以及集群专用系统提示来生成问答 (QA) 对。我们在固定的 词元预算(5 和 2000 万个标记)下,在不同语义异质性的三个数据集上针对 EntiGraph、InstructLab 和 Knowledge-Instruct 评估 EmbGen。我们使用词汇重叠指标、LLM-as-a-judge rubric 和二进制准确性(一种结合事实准确性和完整性的组合指标)进行评估。相对于最强的基线,EmbGen 在 5M 词元预算下将最异构数据集的二进制准确性提高了 12.5%,在 20M 词元预算下提高了 88.9%,同时在异质性较低的其他数据集上保持竞争力。