论文
发明数据集:用零种子测量数据集生成能力
Invent a Dataset: Measuring dataset generation abilities with zero seed
摘要
构建数据集仍然是人工智能开发中最手动且最脆弱的部分之一。在这份技术报告中,我们重点关注现实世界从业者面临的最极端但也是最普遍的环境:零数据制度。在这里,从业者没有任何他们想要学习的能力的数据。我们引入了 Invent-A-Dataset,这是一个基于提示的系统,可以从数据集描述转变为现实的大规模后训练数据集。我们针对五个前沿模型 API(包括 Anthropic、Google、Open AI、DeepSeek、Zai)评估 Invent-A-Dataset。在八种任务类型和高达 20K 样本的数据集大小中,Invent-A-Dataset 的性能显着优于其他人,不仅具有最高的质量(相对增益 17%),而且同时生成最多样化的样本(相对增益 19%)。它的多样性优势随着训练数据集规模的扩大而扩大(从 200 个样本的奇偶性到 20K 样本的 37% 相对增益)。这转化为相当大的下游训练收益,从而产生性能更高的后训练模型。与不同后训练模型架构中的其他生成器微调相比,Invent-A-Dataset 微调始终排名较高。