论文

表格数据的上下文密度估计

In-Context Density Estimation for Tabular Data

模型训练预训练

摘要

密度估计是表格数据上许多无监督任务的基础,例如异常检测、分布外检测和数据增强。尽管所有这些问题都归结为关于概率质量在哪里的问题,但它们通常可以通过将单独的模型拟合到每个数据集(具有自己的超参数和调整预算)来单独解决。我们引入了 ICED,这是一种基于上下文的、基于能量的密度估计器,可以消除每个数据集的成本。 ICED 是一个基于 Transformer 的模型,在专门为密度估计而构建的合成先验上进行了一次预训练,其目标是适合对数密度,其中包含信息并在其他地方保留其顺序。在推理中,它读取数据集作为上下文,并在单个前向传递中返回任何查询点的非标准化对数密度,无需拟合、采样或超参数选择。然后,单个冻结的 ICED 模型驱动通常由四个专用管道处理的四项任务:密度估计、分布外检测、无监督异常检测和生成增强。在这四种方法中,它与最强的特定于任务的方法具有竞争力,同时是唯一不需要重新训练、不需要调整、也不需要在它们之间移动标签的方法。该代码可在 https://github.com/gmum/iced 获取。