论文

使用表格基础模型计算条件Shapley值

Computing Conditional Shapley Values Using Tabular Foundation Models

模型评测评测方法与指标

摘要

Shapley值已成为可解释AI的基石,但使用起来计算代价高昂,尤其当特征相互依赖时。计算它们需要近似大量的条件期望,途径为蒙特卡洛积分或回归。直到最近,回归路线还无法充分利用深度学习,因为为每个条件期望重新训练耗时过长。TabPFN等表格基础模型借助上下文学习克服了这一计算障碍,使每个条件期望都无需任何再训练即可近似。本文使用TabPFN的多个变体计算Shapley值,并在模拟与真实数据集上将其性能与最先进方法进行比较。在大多数情形下,TabPFN取得最佳性能;在未取得最佳时,它也只比最佳方法略逊,而运行时间仅为其一小部分。我们讨论了进一步的改进,以及如何让表格基础模型更好地专门适配条件Shapley值估计。

使用表格基础模型计算条件Shapley值
图1:gam_more_interactions实验的结果:针对测试观测,在不同方法与不同依赖水平ρ下,真实Shapley值与估计Shapley值之间平均绝对误差的箱线图。缩写:GH = 广义双曲(generalized hyperbolic),Ctree = 条件推断树(conditional inference tree),VAEAC = 任意条件化变分自编码器(variational autoencoders with arbitrary conditioning),LM = 线性回归模型,GAM = 广义可加模型,PPR = 投影寻踪回归,RF = 随机森林,NN = 神经网络。所有模型及其相应参考文献的完整描述见[18]。