论文

TrustDABench:用于结构化数据分析的 LLM 的可靠性和稳健性基准测试

TrustDABench: Benchmarking Reliability and Robustness of LLMs for Structured Data Analysis

模型评测基准与评测资源

摘要

LLM 越来越多地用于分析电子表格、CSV 文件和其他结构化数据,但生成看起来正确的答案并不等于生成值得信赖的分析。值得信赖的结果应该得到从用户问题到相关数据证据的有效路径的支持。这一要求产生了两个诊断问题:当这样的路径不存在时,LLM是否可以拒绝回答或要求澄清,以及当相同的证据以不同的表格形式表达时,它是否可以保留正确的分析。我们引入了 TrustDABench,这是一个将这些问题转化为可靠性和稳健性的基准。从证据路径视图开始,我们推导出 19 个扰动算子,并通过基于 Agentic-LLM 的生成框架将它们实例化。 TrustDABench 包含 2,340 个经过人工验证的扰动实例,我们评估了八个代表性的 LLM。结果显示出巨大的空间:GPT-5.5 实现的最佳可靠性结果仅为 24.21% 的平均 MRS,而 Claude-Sonnet-5 实现的最佳鲁棒性结果仍然具有 9.10% 的平均 ASR。这些失败是系统性的:模型很少检测到相互矛盾的证据,通常沿着可执行但不受支持的分析路径继续,并且对改变观察边界或跨表关系的扰动保持敏感。这些发现表明,可靠的结构化数据分析仍然需要更强的证据边界识别和表示不变推理。