论文
Pseudo2CodeQA:代码生成中基于 LLM 的结构化算法推理的基准
Pseudo2CodeQA: A Benchmark for LLM-Based Structured Algorithmic Reasoning in Code Generation
摘要
大语言模型(LLM)在自然语言到代码生成方面取得了令人印象深刻的性能;然而,他们遵循结构化算法推理的能力仍然没有得到充分的了解。我们引入了 Pseudo2Code,这是一个基准测试,旨在系统地评估结构化伪代码对代码生成质量和算法 忠实性 的影响。该基准测试由 300 个手动验证的真实世界编程任务组成,涵盖多个领域和三个难度级别(简单、中等和困难)。每个任务都包含问题描述、结构化伪代码、参考实现和可执行测试套件。为了确保基准测试的可靠性,我们采用双阶段人工验证协议并发布完全可执行的基准测试实例。除了基准测试之外,我们还提出了 Pseudo2Code Agentic Framework,这是一个多级管道,利用伪代码作为代码生成的显式中间推理表示。我们使用基于标准的评估框架来评估商业和开源语言模型,该框架衡量正确性、完整性、相关性、清晰度、推理质量和伪代码遵循性,并辅以基于执行的测试。实验结果表明,所提出的 Pseudo2Code Agentic Pipeline 始终优于强大的商业和开源基线,总体得分为 4.78,而最强基线模型的总体得分为 4.31。此外,一项涉及 100 个基准任务的人工评估研究表明,人工判断与自动评估之间具有很强的一致性。我们的研究结果提供了经验证据,表明结构化伪代码提高了代码生成中的功能正确性、推理质量和算法 忠实性。我们发布 Pseudo2Code 来支持未来对结构化推理、可解释代码生成和可靠的人工智能辅助软件开发的研究。