论文
InfoAtlas:零样本统计依赖性估计的基础模型
InfoAtlas: A Foundation Model for Zero-Shot Statistical Dependence Estimate
摘要
测量高维随机变量之间的统计依赖性是数据科学和机器学习中的一项基本任务。神经互信息(MI)估计器提供了一个有前途的途径,但它们通常需要对每个新数据集进行成本高昂的迭代优化,这使得它们对于实时应用程序来说不切实际。我们提出了 InfoAtlas,这是一种类似基础模型的架构,它通过在单次前向传递中直接推断 MI 来消除这一瓶颈。 InfoAtlas 经过对具有丰富依赖模式的大规模合成数据的预训练,可以学习识别不同的依赖结构并直接从数据集中预测 MI。综合实验表明,InfoAtlas 在准确度上与最先进的神经估计器相匹配,同时实现了 100 倍的加速,可以通过单个统一模型灵活处理不同的维度和样本大小,并有效地推广到复杂的现实场景。通过将 MI 估计重新表述为推理任务,InfoAtlas 为实时依赖性分析奠定了基础。