论文

TRL-Bench:标准化表格编码器的跨范式表示级评估

TRL-Bench: Standardizing Cross-Paradigm Representation-Level Evaluation of Tabular Encoders

模型评测基准与评测资源

摘要

表格编码器通常在特定于任务的端到端管道内进行评估,因此即使来自不同训练范例的模型在类似的表格信号上运行,也很难直接比较。我们引入了 TRL-Bench,这是一种多粒度表格表示学习 (TRL) 基准,可标准化跨范式表示级别评估:每个编码器通过其支持的包装器导出行、列或表嵌入,并共享轻量级头在三个套件中探测它们:TRL-CTbench(列/表)、TRL-Rbench(行)和 TRL-DLTE(跨越所有三个粒度的组合数据湖表丰富)。为了支持这种标准化设置,我们发布了精选的基准资产和任务重新制定,包括 50 个 OpenML 表(具有 123 个经过验证的目标)、16 个行对链接重写以及从 1,379 个父表派生的 47,772 个表 DLTE 湖。 TRL-Bench 在 20 个模型和 16 个任务中表明,一旦下游条件标准化,编码器质量将取决于功能,而不是由单个排行榜捕获。在 TRL-CTbench 中,通用文本编码器通常在具有强表面文本信号的任务中领先,而表格专家在其预训练目标与任务一致的情况下获胜。在 TRL-Rbench 中,表内预测和跨表链接有利于不同的训练机制,原子链接性能与 DLTE 管道的行匹配阶段密切相关。在 TRL-DLTE 中,最强大的管道结合了能力匹配的专家,而不是重复使用单个编码器,并且最高的端到端质量取决于非相加的组合拟合,而不是单独的每级边缘排名。 TRL-Bench 提供了一种通用协议,用于在共享下游条件下测量导出的表格表示中的可重用信号。代码和数据:https://github.com/LOGO-CUHKSZ/TRL-Bench