论文

基于最小充分表示学习的LLM领域数据合成

Domain-Specific Data Synthesis for LLMs via Minimal Sufficient Representation Learning

模型训练合成数据

摘要

大语言模型在通用能力上进展显著,并且通过在领域特定数据上微调可以在具体领域取得强劲表现。然而,如何获取目标领域的高质量数据仍是一大挑战。现有数据合成方法遵循演绎范式,严重依赖以自然语言表达的显式领域描述与精心的提示工程,限制了其在领域难以描述或无法正式表述的现实场景中的适用性。本工作以归纳范式攻克这一尚待充分探索的领域数据合成问题:目标领域仅通过一组参考样本来定义,尤其适用于领域特征难以用自然语言阐明的情形。我们提出新框架DOMINO,它从参考样本中学习最小充分的领域表示,并利用该表示引导生成与领域对齐的合成数据。DOMINO将提示微调与对比解耦目标相结合,把领域级模式与样本特异噪声分离开,在保留核心领域特征的同时缓解过拟合。理论上,我们证明DOMINO扩展了合成数据分布的支撑集,确保更大的多样性。实证上,在领域定义隐含的具有挑战性的编程基准上,使用DOMINO合成的数据微调相比强指令微调骨干最多将Pass@1准确率提升4.63%,展现了其有效性与鲁棒性。本工作确立了领域数据合成的新范式,无需人工提示设计或自然语言领域描述即可实现实用且可规模化的领域适配。

基于最小充分表示学习的LLM领域数据合成:论文配图
图 2:左侧表示最小充分域表示学习过程,其中 t1,⋯,tTt_{1},\cdots,t_{T} 表示参考样本的原始自然语言标记,eme_{m} 表示相应的嵌入。领域级软令牌 𝑫*{\bm{D}}^{*} 和样本级软令牌 𝑺(i){\bm{S}}^{(i)} 是联合优化的。右侧表示仅使用优化的 𝑫*{\bm{D}}^{*} 来合成特定领域的样本。