论文

LLMTabBench:从零到少量镜头评估二进制表格分类上的 LLM

LLMTabBench: Evaluating LLMs on Binary Tabular Classification From Zero to Few Shots

模型评测基准与评测资源

摘要

表格数据的监督分类仍然是机器学习的核心任务,但它对大型标记数据集的依赖限制了其在数据稀缺环境中的适用性。 TabPFN 等小样本方法通过大规模合成预训练实现了强大的性能,但仍然需要标记的上下文示例。 大语言模型 (LLM) 通过从任务描述中进行零样本和少样本上下文学习提供了更灵活的替代方案,但它们在表格数据上的行为仍然不一致。我们引入了 LLMTabBench,这是一个在低数据条件下评估 LLM 表格分类的基准。该基准测试研究 LLM 先验知识如何与任务描述和少数样本交互,以及性能如何随着现实世界和受控合成数据集的数据复杂性的增加而变化。我们发现 LLM 在零样本设置中具有很强的竞争力,有时在给出少量样本的情况下优于模型。然而,额外的示例可能与现有知识相冲突,从而降低性能。我们还观察到 LLM 性能下降并且少数样本变得不太有用的复杂性阈值。这些结果阐明了表格数据上下文学习的关键限制,并为 LLM 在低数据环境中的部署提供了信息。