论文

用于可扩展合成数据生成的动态上下文演化

Dynamic Context Evolution for Scalable Synthetic Data Generation

模型训练合成数据

摘要

当跨多个批次独立提示时,大语言模型 会产生重复输出,我们将这种现象称为跨批次模式崩溃:当语言模型在无法访问其前几代的情况下重复提示时,输出多样性逐渐丧失。从业者长期以来一直通过临时重复数据删除和种子轮换来缓解这种情况,但不存在原则框架。我们引入动态上下文进化(DCE),包括三种机制:(1)言语尾部采样(模型用猜测来标记每个想法的明显程度,并丢弃明显的想法),它通过模型自我评估过滤高概率的候选者; (2)语义记忆,它维护持久的嵌入索引以拒绝跨批次的近似重复项; (3)自适应提示进化,使用记忆状态和旋转多样性策略重建每批的生成提示。在跨三个领域(可持续包装概念、教育考试问题和创意写作提示)和两个模型系列(gpt-5-mini 和 claude-haiku-4-5)的实验中,每种方法对 2-3 个随机种子的组件消融表明,DCE 实现了 0.0 +/- 0.0% 崩溃,而天真的提示为 5.6 +/- 2.0%,同时每个种子与天真的提示相比,产生了 17-18 个 HDBSCAN 簇。挥发性 2-17,表明可靠更丰富的概念结构。这些结果通过独立嵌入模型(全 MiniLM-L6-v2)进行验证,并在 VTS 阈值 tau 和去重阈值 delta 的灵敏度扫描中保持不变。重复数据删除和快速演进单独来看是不够的,但联合起来是有效的,仅使用标准 API 调用,每 1,000 名候选人大约花费 0.50 美元,不需要 微调 或自定义架构。