论文

ADE:以人为本的目标的代理数据演化框架

ADE: Agentic Data Evolution Framework for Human-Centered Objectives

模型训练合成数据

摘要

当目标不可执行且依赖于上下文时,使 大语言模型 与以人为中心的目标保持一致会很困难,从而限制了可靠的验证和可扩展的监督。尽管合成数据扩大了覆盖范围,但薄弱的验证将瓶颈从生成转移到了选择。噪声信号会破坏迭代细化的稳定性,并可能导致无声回归。我们提出代理数据进化(ADE),这是一个以数据为中心的框架,它将综合监督组织为不断发展的数据快照。 ADE 通过闭环观察-变化-选择 (OVS) 程序改进数据快照,其中稳态准入机制充当质量棘轮,保守地控制更新以实现持续的跨轮改进。我们通过互补的内在趋势跟踪和外在 后训练 评估来验证这些改进。在 DEV300 上,ADE 将内在胜率从 50% 提高到 75.81%,外在胜率从 55.20% 提高到 68.86%,在不同的基准测试中保持一致的性能提升。盲法专家评估进一步证实了这一点,66.11% 的人倾向于进化答案。这些成果延伸到 后训练 方法、模型规模和任务,超出了弱可验证的教育目标。资源可在 https://github.com/ZeroLoss-Lab/Agentic-Data-Evolution 获取。