论文
超越问题解决:用于评估竞争性编程中的代码生成、黑客攻击和修复的 UOJ-Bench
Beyond Problem Solving: UOJ-Bench for Evaluating Code Generation, Hacking, and Repair in Competitive Programming
摘要
尽管在竞争性编程中表现强劲,但 大语言模型 (LLM) 在支持相同环境下人类学习方面的作用仍然很大程度上未被探索。在这项工作中,我们介绍了 UOJ-Bench,这是一个基准测试,不仅旨在评估 LLM 解决问题的能力,还评估其识别人类编写代码中的错误的能力——这是一项传统上通过在线判断系统运行测试用例来支持的重要教育活动。 UOJ-Bench 包含三个不同的任务:代码生成、代码破解和代码修复,所有任务都是根据在通用在线法官 (UOJ) 上提交的真实代码构建的,并通过 UOJ 的本地判断基础设施进行评估。我们的结果表明,在一次性评估下,即使是最强大的模型也无法识别 UOJ 用户发现的一组提交内容中超过 50% 的错误。虽然测试时间扩展将成功率提高到 90% 以上,但模型推理产生的大量计算成本限制了其大规模部署的实用性。尽管存在这些限制,我们发现在测试时间缩放下表现最好的模型可以在大约 30 个问题的满分提交中发现超过 5% 的错误,这表明前沿 LLM 已经可以提供超出标准判断系统的补充信号。