论文
TICDA:表格上下文的数据归因
TICDA: Tabular In-Context Data Attribution
摘要
表格基础模型 (TFM) 通过调节上下文中提供的标记演示来实现强大的预测性能,而无需任何参数更新。然而,个人示威如何塑造特定的预测仍然知之甚少。这种差距在实践中很重要:上下文通常是从任何可用的标记数据中组装而成的,可能会导致包含错误标记、冗余或低质量的示例,从而降低性能。标准数据归因方法不会转移到 TFM 设置:基于重采样的方法(例如 DemoShapley)需要组合数量的前向传递,而基于梯度的估计器(例如影响函数)需要计算训练点对模型参数的影响,而上下文学习永远不会更新。我们引入了 TICDA,这是一种直接从在 TFM 潜在嵌入上训练的线性 代理模型 中测量上下文中每个演示的影响的方法,在单次前向传递中且成本可以忽略不计。我们表明,TICDA 在四个任务中提供了与竞争对手相比的最佳折衷方案:检测标签错误、整理上下文以保持预测准确性,同时降低推理成本、生成跨 TFM 传输的归因分数,以及支持高效主动学习的获取策略。
