论文
ORCA:跨数据科学生态的代码翻译基准
ORCA: Evaluating LLMs on Data Science Code Translation
摘要
数据科学代码翻译 (DSCT) 是在数据科学库之间转换代码的过程,同时保持功能等效性并实现跨数据科学生态系统的互操作性。虽然大型语言模型 (LLM) 在数据科学代码生成 (DSCG) 方面取得了长足的进步,但它们在 DSCT 方面的表现仍没有得到充分研究。为了解决这一差距,我们引入了 ORCA,这是一个具有两个互补设置的综合基准测试:ORCA-MAIN,包含 1,600 个精心策划的基础级任务,涵盖 3 个代表性领域:数据查询、数据操作和深度学习; ORCA-PROJECT,其中包含 7 个数据科学任务类型的完整数据科学项目的 200 个翻译任务。每个任务都附有带注释的参考翻译和用于验证功能等效性的测试用例。我们进一步整合了多阶段质量验证流程,彻底验证任务的正确性和测试用例的稳健性。实验结果表明 DSCT 面临挑战,即使是前沿大语言模型也表现出有限的性能。具体来说,Claude-Opus-4.6在ORCA-MAIN上的成功率达到56.92%,在ORCA-PROJECT上的成功率达到33.67%,表明DSCT还有很大的改进空间。我们还观察到 DSCT 中存在明显的方向性偏好,当源代码通过更明确、更细粒度的操作表达任务时,翻译始终会更容易。受此启发,我们提出了一种意图增强方法,其中模型首先推断源代码意图,然后将其用作翻译的附加上下文,在 ORCA-MAIN 和 ORCA-PROJECT 上分别实现平均绝对成功率增益 4.80% 和 5.33%。
