论文
评测语言模型的统计问题形式化能力
Benchmarking Language Models for Statistical Problem Formulation
摘要
大语言模型(LLM)越来越多地用作统计和数据科学工作的助手,但现有的评估很大程度上假设分析目标已经指定。在实践中,用户带着非正式的目标和异构数据到达,让模型来决定隐含的统计任务以及哪些数据是相关的。我们首先将这个上游步骤形式化为统计问题制定,并将其分解为两个子任务:(1)统计问题分类和(2)变量识别和角色分配。然后我们介绍 StatFormBench,这是一个由五本跨领域统计教科书和数据科学案例库构建的基准,涵盖不同的问题类型、数据表示和场景样式。它包含 1,013 个样本,涵盖 20 个粗粒度和 85 个细粒度统计问题类别。在 14 个开源和闭源LLM中,最好的零样本模型仅达到 72.0 的细粒度分类精度和 63.2 的变量集重叠。没有任何模型能够在两个子任务中始终表现最佳,而增强的提示策略只能产生有限或不一致的收益。我们在 https://huggingface.co/datasets/THU-CongLab/StatFormBench 上发布了 Hugging Face 的基准数据,并在 GitHub 上发布了评估代码:https://github.com/THU-CongLab/StatFormBench。
