论文
LLM时代还值得训练经典模型吗?表格数据的交叉基准
Is It Still Worth Training a Classical Model in the Era of LLMs? A Crossover Benchmark on Tabular Data
摘要
大型语言模型可以在无需训练的情况下从简单的英语描述中标记表格行 - 这一功能现在已在主流电子表格工具中提供,例如 Excel 中的 Microsoft Copilot 和 Anthropic 的 Claude for Excel - 为标签昂贵的许多业务预测问题提出了一个实际问题:您应该提示冻结 LLM,还是收集数据并训练模型 - 如果是,需要多少数据?我们用标记数据交叉 N* 来量化答案,即经过训练的经典模型的学习曲线超过冻结的 LLM 的无训练(因此平坦)误差的训练集大小。汇总 126 个独立学生对 18 个表格数据集的 8 种提示配置下的小型 GPT 模型的评估,并搭配六个经典模型系列的权威幂律学习曲线,我们发现训练很快就会获胜:即使给出了最佳提示配置的预言机选择,经过训练的经典模型在 86% 的情况下使用不超过现有标记数据的方式击败了小型冻结 LLM,并以我们在 40% 中评估的最小标记子集获胜,并观察到交叉训练集的中位数约为 6%。上下文中的少数样本示例的行为与训练不同 - 错误与样本计数不遵循幂律 - 并且独立实施者重新运行的相同协议的变化系数为 0.148。受控探针表明 LLM 依赖于可识别的特征名称语义,这似乎使我们的交叉成为保守估计(我们不要求记忆)。对于典型的业务表,证据很明确:收集数百个标签并训练梯度增强模型。