论文

Multi-LCB:把LiveCodeBench扩展到多编程语言

Multi-LCB: Extending LiveCodeBench to Multiple Programming Languages

模型评测基准与评测资源

摘要

LiveCodeBench(LCB)近期已成为评估大语言模型(LLM)代码生成任务的广泛采用基准。通过策展竞赛编程题、持续向题集添加新题并按发布日期过滤——LCB提供防污染评估并提供编码能力的整体视图。但LCB仍限于Python——留下LLM能否泛化到真实软件工程所需的多样编程语言这一开放问题。我们介绍Multi-LCB——跨包括Python在内的12种编程语言评估LLM的基准。Multi-LCB把LCB数据集的Python任务转换为其他语言中的等价任务——同时保留LCB的污染控制与评估协议。因为它与原LCB格式完全兼容——Multi-LCB将自动追踪未来LCB更新——实现跨语言代码生成能力的系统评估——要求模型把性能维持远超Python。我们在Multi-LCB上评估24个指令与推理LLM——发现Python过拟合、语言专属污染与多语言表现的巨大差异的证据。我们的结果确立Multi-LCB为多编程语言代码评估的严格新基准——直接解决LCB的主要局限——并暴露当前LLM能力的关键缺口。

Multi-LCB:把LiveCodeBench扩展到多编程语言:论文配图
图 1:多 LCB 概述。上图:LCB 自然语言问题描述被包装到指定目标编程语言的提示中,并传递到 LLM 以生成 STDIN/STDOUT 代码。 AtCoder 和 Codeforces 问题测试直接传递到执行阶段。底部:LeetCode 问题测试通过专用测试转换器进行转换,以产生等效的 STDIN/STDOUT 输入。生成的代码以目标编程语言编译或执行,并使用 Pass@1 进行评估。