论文

通过分布优化合成扩展 LLM 知识边界

Scaling LLM Knowledge Boundaries via Distribution-Optimized Synthesis

模型训练合成数据

摘要

通过合成数据进行知识注入对于增强 大语言模型 (LLM) 至关重要。然而,当前的合成方法只是停留在预设的词元数量或固定的数据比例上,缺乏对知识分布的认识。这导致一些领域稀疏,而另一些领域冗余,限制了 LLM 知识边界。我们从分布角度重新审视知识注入,并假设存在最优知识分布以最大化知识边界扩展。我们提出了KDoS(知识分布优化综合),这是一个引入知识密度的框架,通过三阶段反馈机制驱动综合,从盲目生成转变为分布优化综合。我们构建了具有不同知识分布的基于维基百科的合成数据,并对从 0.6B 到 16B(Qwen、Ling、LLaMA)的模型和从 1B 到 5B 词元的数据规模进行了实验。我们的主要发现是:(1)最优的知识分布始终使边界扩展最大化; (2) 这种分布在骨干网和规模上是稳定的; (3) KDoS 在六个知识基准方面的表现优于基线。我们的工作为合成数据驱动的知识注入提供了新的视角和实用框架。