论文

推理驱动的合成数据生成与评估

Reasoning-Driven Synthetic Data Generation and Evaluation

模型训练合成数据

摘要

尽管许多受关注的 AI 应用需要专用的多模态模型,但训练此类模型所需的相关数据天然稀缺或难以获取。用人工标注来填补这些缺口成本高昂、易出错且耗时,这促使模型构建者越来越多地将合成数据视为可扩展的替代方案。然而,现有合成数据生成方法往往依赖人工提示、进化算法或来自目标分布的大量种子数据,限制了它们的可扩展性、可解释性与可控性。在本文中,我们提出 Simula:一个新颖的推理驱动的数据生成与评估框架。它采用无种子、智能体化的方法大规模生成合成数据集,允许用户通过一个可解释、可控的过程来定义所需的数据集特性,从而实现细粒度的资源分配。我们在多种数据集上展示了该方法的有效性,对内在属性与下游属性都进行了严格测试。我们的工作 (1) 为合成数据的机制设计提供指南,(2) 为大规模合成数据的生成与评估提供洞见,(3) 为在数据稀缺或隐私问题至关重要的领域开发和部署 AI 开辟新机会。

推理驱动的合成数据生成与评估:论文配图
图 2:Simula 框架示意图。给定用户指令 yy 和/或数据样本 𝒮\mathcal{S},我们首先 (a) 确定感兴趣的因子 fif_{i},(b) 将其扩展为分类法 𝒯i\mathcal{T}_{i}。接下来,(c) 对 𝒯i\mathcal{T}_{i} 的节点进行采样以获得混合,并 (d) 转换为“元提示”。用户定义的元提示分数 cc 是“复杂的”。 (e) 最后,元提示用于由生成器生成数据建议,并使用 Critic 步骤进行迭代细化。