论文

无中生有:语言模型能发现0吗?

Nothing from Something: Can a Language Model Discover 0?

模型评测模型能力评测

摘要

基于人工神经网络的AI系统正被开发——怀抱推进人类数学知识边界的愿望。这些系统的关键问题是它们能超出训练数据多远。数学发现需要强形式的分布外泛化:假设真正新的——且潜在逻辑上更强——数学结构的能力。已有假说认为语言能力支撑人类认知中的此类泛化。本工作中——我们以简单算术为案例研究——考察现代AI模型如何拓展其数学视野——评估这些模型能否独立发现“零”的概念。我们表明:(1) GPT-2规模的语言模型无论语言预训练与否——都无法在测试时执行该泛化——但(2) 模型在零的数十或数百示例上训练后可大幅改进。此外——我们发现语言预训练把所需示例数减少约50%——表明语言能力能在神经模型中为数学发现搭建脚手架。

无中生有:语言模型能发现0吗?:论文配图
图 1:算术实验的训练和测试数据示例。保留包含零(个位除外)的示例,并且标记化是按数字进行的。