论文

StatABench:评估LLM统计分析能力的数据集和框架

StatABench: Dataset and Framework for Evaluating Statistical Analysis Capabilities of LLMs

模型评测基准与评测资源

摘要

统计分析是一个广泛而复杂的领域,需要领域知识和工具熟练程度。虽然之前的工作已经评估了该领域的 大语言模型 (LLM),但现有基准测试的范围和格式仍然有限。为了弥补这一差距,我们引入了StatABench(统计分析基准),这是一个旨在系统评估LLM统计分析能力的基准。 StatABench 包含两个互补的组件:Stat-Closed,包含多种格式(多项选择、填空、决策和实际应用)的 18 个统计主题的 404 个问题,以及 Stat-Open,包含 30 个改编自专业比赛的复杂开放式建模任务。我们使用 LangChain MCP 框架和多个数据科学代理评估各种 LLM,并通过经过验证的 LLM-as-Judge 协议评估 Stat-Open 解决方案。实验表明,即使是 GPT-5.1 在 Stat-Closed 上也只能达到 68.6%,而最好的开源模型达到 60.6%。在 Stat-Open 上,顶级代理框架平均得分为 61.86。这些结果揭示了当前 LLM 与可靠统计分析之间的差距,凸显了基于工具的推理、方法决策和端到端统计建模方面持续存在的挑战。