论文

超越翻译准确性:解决基于 LLM 的代码翻译中的错误故障

Beyond Translation Accuracy: Addressing False Failures in LLM-Based Code Translation

模型评测评测方法与指标

摘要

大语言模型(LLM)在自动化代码翻译方面取得了显着的成功。虽然之前的工作重点是通过高级提示和迭代修复来提高翻译准确性,但底层评估框架的可靠性却很少受到关注。在本文中,我们证明了代码翻译中报告的大量失败并不是由于不正确的逻辑,而是由于不正确的编译标志、缺少库链接和未配置的运行时环境而导致的评估引起的错误。我们对五种编程语言(C、C++、Java、Python、Go)和三个基准测试(Avatar、CodeNet、EvalPlus)进行了大规模实证研究,涵盖了 GPT-4o、DeepSeek-Coder 和 Magicoder 生成的 6,164 个翻译。我们的分析对常见的漏报进行了识别和分类,将影响任何模型的管道引发的故障与 LLM 中不同的模型相关行为区分开来。我们的研究结果强调了透明的、配置感知的评估标准的必要性,以准确评估基于 LLM 的代码翻译的进展。