论文
持续自我改进的AI
Continually self-improving AI
摘要
现代基于语言模型的AI系统功能强大,但其能力仍在三个关键方面从根本上受限于人类创造者。首先,尽管模型权重可以通过微调更新,但预训练之后从小型专用语料中获取新知识仍然极不省数据。其次,这些系统的训练严重依赖历史上有限的、由人类生成的数据。第三,用于训练AI模型的流水线受限于人类研究者能够发现和探索的算法。本论文朝克服这些固有局限迈出了一小步,呈现了旨在打破这些依赖以创建持续自我改进AI的三个章节。首先,为克服知识获取中的数据效率障碍,我们提出一种合成数据方法,将小型语料多样化并放大为丰富的知识表示,使模型能够从有限的源材料中有效更新其参数。其次,为减少对人类数据的依赖,我们表明在给定固定数量的此类数据时,模型可以自我生成合成数据来引导其基础预训练能力,而无需从任何现成的指令微调语言模型(LM)蒸馏。最后,为超越人工设计的训练范式,我们证明通过在测试时对算法空间进行规模化搜索,AI可以搜索比人类研究者手工探索更大的学习算法配置空间。
