论文
ScoringBench:使用适当评分规则评估表格基础模型的基准
ScoringBench: A Benchmark for Evaluating Tabular Foundation Models with Proper Scoring Rules
摘要
TabPFN 和 TabICL 等表格基础模型已经产生了完整的预测分布,但流行的回归基准几乎完全通过点估计指标 RMSE R2 对其进行评估。这些汇总指标通常会掩盖分布尾部的模型性能,这是金融和临床研究等领域高风险决策的关键缺陷,在这些领域,不对称风险状况是常态。更丰富的概率预测质量图 我们通过一系列回归基准评估使用不同评分规则目标和 TabICL 进行微调的 realTabPFNv2.5 相对于未调整的 realTabPFNv2.5 我们的结果证实模型排名取决于所选的评分规则,并且没有单一的预训练目标是普遍最佳的 这表明,对于对极端事件敏感的应用程序,评估指标的选择与数据本身一样是特定于领域的要求 ScoringBench 可在https://github.com/jonaslandsgesell/ScoringBench 当前排行榜的实时预览可在 https://scoringbench.bolt.host 上获取。排行榜通过 git pull 请求进行维护,以确保透明度、可追溯性、敏捷性和可重复性
