论文
为什么 大语言模型 表格预测失败
Why Large Language Models Fail at Tabular Prediction
摘要
大语言模型 (LLM) 已成为执行一系列非凡任务的默认工具,但它们在最常见的机器学习工作负载之一:表格数据的预测分析方面却几乎没有取得成功。这一差距是快速发展的表格基础模型领域的奠基前提,但为什么通用 LLM 失败的问题仍然悬而未决。我们研究了最纯粹的推理机制中的前沿 LLM - 一代人传递了包含完整训练和测试数据的提示,没有工具,没有代理脚手架,也没有 微调 - 并系统地评估了失败的五个假设:(a)无法处理噪声或非线性可分离数据; (b) 线性化 CSV 格式模糊了列结构; (c) 数值的标记化; (d) 每个查询分类的测试点数量; (e) 输入的维度。对照实验证伪了 (a)-(d)。相比之下,维度是决定性的:LLM 扫描了 31 个基准数据集的随机线性投影,是 9 种方法中唯一一种精度随着维度的增长而降低的方法,而每个经典基线都保持平坦或提高。与 252 个配置的经典模型的行为比较发现,在二维中,LLM 的预测类似于基于本地距离的方法(高达 91.6% 的网格一致性),但在更高维度中,没有经典模型(即使使用调整的、与维度相关的噪声进行增强)重现其预测。我们并不声称已经确定了内部机制;我们的结果更温和地表明,LLM 的能力会随着维度的变化而消失,而这种方式是受噪声破坏的经典学习器无法模仿的——这解释了为什么 LLM 在其他地方如此强大,但在表格上不断输给 50 年前的基线,同时使预测机制成为一个悬而未决的问题。