论文
编译表格:用于表格上下文学习的查询校准运算符压缩
Compile the Table: Query-Calibrated Operator Compression for Tabular In-Context Learning
摘要
表格上下文学习 (ICL) 已成为表格预测的免训练且准确的范例,但当前压缩上下文示例的方法面临准确性与吞吐量的权衡:固定子集可能会牺牲准确性,而特定于查询的检索会限制缓存重用和跨查询的批处理,从而降低吞吐量。我们提出了 QCOC(查询校准运算符压缩),它通过将完整的 KV 缓存一次编译到后续查询共享的紧凑内存中,利用上下文示例的可交换性和重复使用。 QCOC 没有保留原始示例,而是将其状态聚类为联合 KV 原型,保留每个聚类的多重性和原始示例计数,并通过锚定的封闭式解决方案根据上下文示例生成的注意查询向量来校准原型值。原型压缩可提高速度,而值拟合有助于保持准确性。在 64 个保留的 OpenML-CC18 数据集上,QCOC 在比较的压缩和检索方法中实现了最高的平均准确率 保留计数。在 7 个长表的 12 种配置中,它在 10 种压缩方法中排名第一,平均比完整上下文低 0.23 个百分点。将 8,192 个上下文示例压缩到 512 个内存插槽,可产生 10.5 倍的缓存压缩比;不包括一次性编译,在超过 1,000 个查询的单核 CPU 在线服务比较中,QCOC 比动态检索基线快 508 倍,比全上下文推理快 1.98 倍。这些结果表明,QCOC 可实现紧凑内存重用和跨查询的高效推理,同时保持接近完整上下文的准确性。