论文
数据语言模型:面向表格数据的新基础模型类
Data Language Models: A New Foundation Model Class for Tabular Data
摘要
现在,每种主要数据模态都有一个可以原生理解的基础模型:文本有语言模型,图像有视觉模型,音频有音频模型。表格数据是现实世界中许多重要的人工智能决策的模态,却缺乏这类原生基础模型。如今,从梯度提升树到最新的表格基础模型,每种表格人工智能方法都需要预处理管道,然后任何模型才能使用数据。他们都不将表格数据理解为一种模式。我们介绍数据语言模型(DLM),这是表格数据缺失的基础模型。 DLM 理解表格的方式与语言模型理解句子的方式相同:直接从原始单元格值原生处理,无需序列化或预处理。它是可以在其上构建人工智能模型、代理和垂直人工智能应用程序的表格数据层,从而消除了当前位于原始数据和使用该数据的每个人工智能系统之间的预处理管道。我们提出了 Schema-1,第一个 DLM:一个在超过 230 万个合成和真实表格数据集上训练的 140M 参数模型。 Schema-1 的性能优于梯度提升集成、AutoML 堆栈以及我们在已建立的行级预测基准上评估的表格基础模型。在缺失值重建方面,它在跨条件的平均性能上比所有经典统计方法和前沿大语言模型实现了更低的重建误差,建立对数据集自身分布几何的结构理解比用语言编码的世界知识更有助于插补。它仅根据原始单元值可靠地跨任何领域识别任何看不见的数据集的行业部门,这是先前表格模型无法执行的任务。它是人工智能堆栈中缺失的原生表格理解层。