论文

以表格基础模型进行免训练图节点保形预测

Valid for Free: Homophily-Gated Conformal Prediction for Training-Free Node Classification with Tabular Foundation Models

模型评测鲁棒性、公平性与可信度评测

摘要

表格基础模型 (TFM) 可以通过将节点和邻域特征读取为标记上下文行旁边的表行,对没有训练的图的节点进行分类。这方面的工作报告预测性能,而不是保形覆盖或预测集大小。据我们所知,我们给出了该设置的第一个可靠性研究,其中 TabICL 作为 TFM,每个图的一半作为标记上下文。对于校准前固定的任何预测器,冻结的上下文预测器使分割共形预测在有限样本中完全有效,无需训练、验证折叠或对目标图进行调整。对 10 个图表的审核表明,无需训练 TabICL 后验的预期校准误差 (ECE) 低于其中 9 个图表上具有温度缩放 (GCN+TS) 的 GCN。十张图的平均 ECE 为 0.019,比 GCN+TS 的 0.029 低约 35%。我们还引入了 HG-DAPS,这是一种 无需训练扩散分数,其同质门仅读取上下文中的标签,因此保证仍然成立。相对于自适应预测集 (APS),它在六个同亲图上将平均集大小减少了 5.8% 到 17.1%,在四个异亲图上将平均集大小减少了不到 1%。在两个二元类不平衡图上,预先注册的陷阱情况表明,对原始同质性而不是调整后的同质性进行选通会将低同质性节点之间的覆盖率降低 0.27 和 0.12。边际覆盖率保持在名义 0.90,掩盖了这一下降。

以表格基础模型进行免训练图节点保形预测:论文原图
图 2:$\alpha=0.10$ 的可靠性审核。数据集按上下文估计 $\hat{h}_{\mathrm{adj}}$(在括号中)排序,虚线规则将同源 ($\hat{h}_{\mathrm{adj}}>0.5$) 与异源 ($\hat{h}_{\mathrm{adj}}<0.2$) 图分开。 (a) 对于 TabICL、GCN+TS 和 MLP,具有 15 个等质量箱 [21] 的 ECE,TabICL 和 GCN+TS 值在表 I 中。 (b) TabICL 后部上 LAC、APS 和 RAPS 的边际覆盖率,平均超过 60 次校准/测试重新划分,作为与标称 $0.90$ 的偏差。对于 $n_{\mathrm{test}}$ 试验,误差线是每个平均值的精确 95% Clopper-Pearson 区间 [22]。它们的大小适用于一个测试集,而不是 60 次分割的平均值,并且每个误差条都覆盖标称水平。