论文

持续自我改进的AI

Continually self-improving AI

模型训练合成数据

摘要

现代基于语言模型的AI系统功能强大,但其能力仍在三个关键方面从根本上受限于人类创造者。首先,尽管模型权重可以通过微调更新,但预训练之后从小型专用语料中获取新知识仍然极不省数据。其次,这些系统的训练严重依赖历史上有限的、由人类生成的数据。第三,用于训练AI模型的流水线受限于人类研究者能够发现和探索的算法。本论文朝克服这些固有局限迈出了一小步,呈现了旨在打破这些依赖以创建持续自我改进AI的三个章节。首先,为克服知识获取中的数据效率障碍,我们提出一种合成数据方法,将小型语料多样化并放大为丰富的知识表示,使模型能够从有限的源材料中有效更新其参数。其次,为减少对人类数据的依赖,我们表明在给定固定数量的此类数据时,模型可以自我生成合成数据来引导其基础预训练能力,而无需从任何现成的指令微调语言模型(LM)蒸馏。最后,为超越人工设计的训练范式,我们证明通过在测试时对算法空间进行规模化搜索,AI可以搜索比人类研究者手工探索更大的学习算法配置空间。

持续自我改进的AI:论文配图
图 2.1:综合持续预训练(综合 CPT)将小型源语料库转换为大型合成语料库,可以通过标准持续预训练进行学习。我们使用称为 EntiGraph 的合成数据增强算法来实例化合成 CPT,该算法在从文档中提取的实体上形成知识图,然后提示 LM 合成该图的基于文本的表示。