论文

DARE-bench:评估LLM在数据科学中的建模与指令保真度

DARE-bench: Evaluating Modeling and Instruction Fidelity of LLMs in Data Science

模型评测模型训练强化学习基准与评测资源Agentic RL

摘要

使用大语言模型(LLM)处理复杂多步数据科学任务的需求快速增长,催生了对精确基准测试的新兴需要。现有基准存在两大空白:(i)缺乏能捕捉指令遵循与过程保真度的标准化、过程感知评估;(ii)准确标注的训练数据稀缺。为弥合这些空白,我们推出DARE-bench,一个面向机器学习建模与数据科学指令遵循的基准。与许多依赖人类或模型评判的现有基准不同,DARE-bench的所有任务都有可验证的真实答案,确保客观且可复现的评估。为覆盖广泛任务并支持智能体工具,DARE-bench由6,300个源自Kaggle的任务组成,同时提供大规模训练数据与评估集。大量评估表明,即使是gpt-o4-mini这样能力很强的模型也难以取得良好表现,在机器学习建模任务上尤其如此。使用DARE-bench训练任务进行微调可大幅提升模型性能。例如,监督微调使Qwen3-32B的准确率提升1.83倍,强化学习使Qwen3-4B的准确率提升8倍以上。这些显著改进验证了DARE-bench作为精确评估基准与关键训练数据的双重重要性。

DARE-bench:评估LLM在数据科学中的建模与指令保真度
图2:DARE-bench 的自动化流水线。构建过程由四个阶段组成:(1) 数据集获取(Dataset Sourcing),按标签、许可证、大小与元数据过滤 Kaggle 数据集;(2) 任务设计(Task Design),借助 LLM 分析模式摘要(schema summaries)、目标、特征与可行性;(3) 后处理(Post-Process),包括切分、针对 IF 任务的噪声注入,或针对 time-series-CF 任务的重采样或实体检查;(4) 定稿(Finalization),为 IF 任务在沙箱中验证可解性,并产出标准化的基准产物。