论文
DSEffi-Bench:揭秘 大语言模型 高效数据科学代码生成能力
DSEffi-Bench: Demystifying Large Language Models' Capability in Efficient Data Science Code Generation
摘要
当前的数据科学 (DS) 代码生成基准将正确性与质量等同起来,忽略了正确解决方案之间跨数量级的执行时间差异。我们推出了 DSEffi-Bench,这是第一个专门针对 LLM 生成的 DS 代码的执行效率的基准测试,包含 10 多个 DS 库中的 1,000 个实例,以及压力测试工具和人工验证的参考。通过评估 3 层中的 16 个模型,我们发现仅正确性无法表征效率:GPT-5.4 在正确性方面领先(通过,66.9\%),但其效率得分(B$|$P,71.7\%)几乎与 GPT-5.4-mini(71.6\%)相匹配,后者解决了 47 个任务; Kimi-K2.5 在前沿模型中正确率排名最低 (40.2\%),但在所有 16 个模型中实现了最高的效率得分 (73.6\%)。人工注释的五类分类法显示,79.1% 的效率缺陷超出了算法复杂性,延伸到了特定领域的根本原因,并且跨模型层和库具有不同的故障特征。两项探索性实验提供了初步证据,表明这些诊断可以指导改进,通过分类引导的优化产生高达 +14.7\% 的效率增益,并通过库条件路由以 13.0$\times 的较低成本接近 Claude-Opus-4.6 Best@3。