论文

学会从上下文中学习:从受干扰的公共文档中进行综合训练

Learning to Learn from Context: Synthetic Training from Perturbed Public Documents

模型训练合成数据

摘要

现实世界的任务通常需要大语言模型(LLM)来从复杂的特定于任务的上下文中学习,而不是预先训练的参数知识。这种能力仍然是LLM的弱点,而此类任务上下文的人工注释成本高昂且难以扩展。公共高质量文档是一种丰富的选择,但公共网络的大部分内容已经在预训练期间被消耗:天真地对此类文档进行训练会奖励记忆而不是上下文学习。在这项工作中,我们尝试利用扰动较小的高质量公共文档,并凭经验发现LLM可以成功生成上下文相关的推理轨迹和答案,然后用于训练学生模型。具体来说,我们构建了一个综合管道,(i)重写源文档以降低记忆风险,(ii)生成需要对文档进行推理的问题和评分规则,(iii)以文档作为上下文回答问题,以及(iv)仅接受真正依赖于文档的样本。在没有任何人工注释者的情况下,我们的管道可以从约3,500份文档中生成大约 10k 个样本,并且生成的学生模型大大提高了 CL-bench 上的性能。 SFT 将 Qwen3.6-35B-A3B 学生从 13.7% 提高到 22.8%,随后的评分规则奖励 RL 阶段达到 24.6%,在 CL-bench 上与超过一万亿个参数的前沿模型 Qwen3.8-2.4T (23.9%) 相当。我们还观察到长上下文理解、指令遵循和推理的广泛改进,而代码生成和知识基本保持不变。我们希望这项工作提供一种可重复且可扩展的方法来提高LLM从上下文中学习的能力,并促进基于上下文的推理的进一步研究。