表格数据是一种基础的数据结构形式。表格分析工具的演进反映了人类在数据获取、管理与处理上的持续进步。表格列的动态变化源于技术进步、需求变化、数据整合等。然而,在固定列表格上训练 AI 模型再进行推理的标准流程,不适合处理动态变化的表格。因此,需要能以无监督方式高效处理此类表格的新方法。本文提出一个新任务——表格增量推理(TabII),旨在让训练后的模型在推理阶段纳入新列,增强 AI 模型在表格动态变化场景中的实用性。此外,我们证明该新任务可被框定为基于信息瓶颈理论的优化问题,其强调理想的表格增量推理方法的关键在于最小化表格数据与表示之间的互信息,同时最大化表示与任务标签之间的互信息。在该指导下,我们设计了带大语言模型占位符与预训练 TabAdapter 的 TabII 方法以提供外部知识,并设计增量样本凝缩块来凝缩增量列属性给出的任务相关信息。跨八个公开数据集的实验结果表明,TabII 有效利用增量属性,取得最先进性能。
图3:TabII 架构概览。该架构由受信息瓶颈理论启发的两个主要组件构成,用于增大 I ( Z , Y ) I(Z;Y) 并减小 I ( X , Z ) I(X;Z) :Placeholder 处理输入的表格数据,包括附加了零的训练样本 [ x i , 0 ] [x_{i},0] 和测试样本 x j ′ x_{j}^{\prime} ,把它们分入三条路径,并把表格编码器( t i t_{i} , t j t_{j} )、TabAdapter( p i p_{i} , p j p_{j} )与 Large Language Model 编码器( l i l_{i} , l j l_{j} )的输出拼接为 r i r_{i} 和 r j r_{j} 。随后,Incremental Sample Condensation 模块使用 Multi-head Self-Attention(MSA)和 Interior Incremental Sample Attention(IISA)融合这些模态表示,生成对下游任务有用的 z i z_{i} 和 z j z_{j} 。IISA 中的 q i q_{i} 、 k i k_{i} 和 v i v_{i} 表示样本的 query、key 和 value 向量, d d 为 key 向量的维度。