论文
DARE-bench:评估LLM在数据科学中的建模与指令保真度
DARE-bench: Evaluating Modeling and Instruction Fidelity of LLMs in Data Science
摘要
使用大语言模型(LLM)处理复杂多步数据科学任务的需求快速增长,催生了对精确基准测试的新兴需要。现有基准存在两大空白:(i)缺乏能捕捉指令遵循与过程保真度的标准化、过程感知评估;(ii)准确标注的训练数据稀缺。为弥合这些空白,我们推出DARE-bench,一个面向机器学习建模与数据科学指令遵循的基准。与许多依赖人类或模型评判的现有基准不同,DARE-bench的所有任务都有可验证的真实答案,确保客观且可复现的评估。为覆盖广泛任务并支持智能体工具,DARE-bench由6,300个源自Kaggle的任务组成,同时提供大规模训练数据与评估集。大量评估表明,即使是gpt-o4-mini这样能力很强的模型也难以取得良好表现,在机器学习建模任务上尤其如此。使用DARE-bench训练任务进行微调可大幅提升模型性能。例如,监督微调使Qwen3-32B的准确率提升1.83倍,强化学习使Qwen3-4B的准确率提升8倍以上。这些显著改进验证了DARE-bench作为精确评估基准与关键训练数据的双重重要性。
