论文

本地化 TabICLv2:通过 k-NN 扩展表格上下文学习

Localized TabICLv2: Scaling Tabular In-Context Learning through k-NN

上下文与知识上下文工程

摘要

近年来,表格数据的基础模型取得了重大进展,TabICLv2 在多个表格分类任务上报告了最先进的性能。然而,全上下文表格 ICL 仍然面临着注意力成本随着训练上下文大小而增长的问题,这限制了其有效处理大型数据集的能力。 Localized TabICLv2 引入了一种方法,该方法通过仅检索每个测试点的 k 个最近训练邻居(通过模型第 2 阶段行表示空间中的相似性进行测量)来降低 TabICLv2 的推理成本,而不是使用完整的训练上下文。这不需要架构上的改变,并且我们证明可以通过额外的第 2 阶段和第 3 阶段 微调 来提高准确性保留。在 TabArena 分类任务上,经过微调的本地化模型保留了 98.64% 的 Full TabICLv2 准确率,并且在批量推理中实现了中值 2.18$\times$ 加速,并在单查询服务设置中达到了大约 249$\times$ 中值加速。