论文

让LLM通过反馈从流式经验中学习合成

Make LLM Learn to Synthesize from Streaming Experiences through Feedback

模型训练合成数据

摘要

大语言模型(LLM)已被广泛用于合成数据生成,显著降低了标注成本。然而,现有研究大多将合成视为一组孤立任务,忽视了一个更根本的问题:模型能否通过从过往任务中积累经验并将其迁移到未来任务来学习合成。本工作提出StreamSynth这一新设定:合成任务依次到达,历史任务的经验为未来合成提供有信息量的信号。为应对该设定,我们提出SynLearner,一个使合成模型能在任务流上积累可复用合成经验的通用框架。SynLearner不再为每个任务独立生成数据,而是鼓励模型随任务演化探索多样的合成模式、从反馈中学习,并在样本质量与集合级多样性之间取得平衡。在多个基准上的大量实验表明,SynLearner能有效利用早期任务的经验来提升后续任务的合成性能,展现出一致的跨任务可迁移性。这些发现为StreamSynth设定的可行性提供了证据,并表明合成数据生成是一种可以从任务流中受益的经验驱动过程。

让LLM通过反馈从流式经验中学习合成:论文配图
图 1:综合范式的比较。 (a) 从头开始​​:由固定规则或启发式指导生成。 (b) 从种子开始:从小种子组扩展。 (c) 从反馈中学习:我们提出的范例,其中综合模型通过反馈和先前的经验逐步改进其综合行为。