论文

大语言模型在表格扭曲下鲁棒性的实证研究

An Empirical Investigation of Robustness in Large Language Models under Tabular Distortions

模型评测鲁棒性、公平性与可信度评测

摘要

我们研究当表格数据在原本规范的表示中遭受语义与结构扭曲时,大型语言模型(LLM)会如何失败。我们的发现揭示,LLM缺乏检测并纠正表格表示中细微扭曲的固有能力。只有当通过系统提示提供显式先验时,模型才会部分调整其推理策略并纠正部分扭曲,但并不持续、也不彻底。为研究这一现象,我们引入一个由专家整理的小型数据集,显式地在需要先执行额外纠错步骤再进行分析的表格问答(TQA)任务上评测LLM。我们的结果揭示,LLM在扭曲下摄取和解释表格信息的方式存在系统性差异,即便是GPT-5.2这样的最先进模型,在扭曲下准确率也至少下降22%。这些发现为未来研究提出了重要问题,尤其是模型应何时以及如何自主决定重新对齐表格输入——类比人类行为——而不依赖显式提示或表格数据预处理。