论文
大语言模型在竞技编程上失败在哪里?按算法类型和难度等级划分的失败分类
Where Do Large Language Models Fail on Competitive Programming? A Taxonomy of Failures by Algorithm Type and Difficulty Rating
摘要
大语言模型 (LLM) 在竞争性编程基准方面表现出日益提高的熟练程度,但技术报告主要发布总体通过率,掩盖了特定领域的漏洞。我们使用跨七个算法类别和三个难度级别的 315 个 Codeforces 问题的平衡分类法,对 LLM 故障模式进行了系统的实证研究。我们在严格的基于执行的条件下评估 GPT-4o 和 Claude Sonnet 4.6,控制温度 (T = 0.2)。为了隔离推理框架对算法正确性的影响,我们进行了一项消融研究,将直接零样本生成与零样本思想链(CoT)进行比较。我们的研究结果揭示了与标准 NLP 基准的严重背离:迫使 CoT 严厉惩罚 GPT-4o,将其通过率从 46.0% 降至 36.8%,并加剧了贪婪逻辑的关键弱点。相反,虽然 Claude 保持了较高的逻辑基线(CoT 下为 63.5%),但扩展的文本生成严重降低了其 Markdown 指令的遵守情况,导致其编译错误增加了三倍多(从 9 到 31,增加了 244%)。此外,故障模式分析表明,错误答案 (WA) 是这两个模型的主要结论——占 GPT-4o 的 90% 以上,占 Claude 不可接受的解决方案的大约 70%。这些发现从经验上证明,标准提示工程技术无法弥合竞争性编程环境中的算法推理差距。