论文

野外数据分析:针对现实世界数据复杂性对 大语言模型 进行基准测试

Data Analysis in the Wild: Benchmarking Large Language Models Against Real-World Data Complexities

模型评测基准与评测资源

摘要

当前在数据分析中评估 大语言模型 (LLM) 的基准通常无法反映现实世界的设置。他们通常专注于从小表中检索事实,而忽视大型多表数据集、外部知识集成和探索性洞察发现的挑战。我们介绍 DataGovBench,这是一个源自政府开放数据的基准,旨在评估实际场景中的 LLM。该基准包括两项任务:表 QA 需要解决复杂的可分解问题并生成文本答案或可视化,表洞察则评估模型通过探索性数据分析生成专家级结果的能力。使用最先进的 LLM 进行的综合实验(无论有没有代理框架)都揭示了这两项任务之间的显着性能差距。这些结果表明,当前基于 LLM 的系统仍远远不能满足现实世界数据分析的需求。 DataGovBench 为推进 LLM 的研究提供了一个具有挑战性的基准,该基准能够回答分析查询并从数据中发现见解。代码和示例数据可在 https://github.com/SoHasekawa/datagovbench 获取。