论文
代码生成编程语言的分类
A Taxonomy of Programming Languages for Code Generation
摘要
世界上 7,000 多种语言在 NLP 资源的可用性方面存在很大差异,这促使人们努力根据其资源丰富程度对它们进行系统分类(Joshi 等人,2020)。编程语言(PL)之间也存在类似的差异;但是,尚未为代码建立资源层分类法。随着 大语言模型 (LLM) 生成代码的能力越来越强,这样的分类法变得至关重要。为了填补这一空白,我们提出了第一个可复制的 PL 资源分类,将 646 种语言分为四层。我们发现,只有 1.9% 的语言(第 3 级,高)占七个主要语料库中所有标记的 74.6%,而 71.7% 的语言(第 0 级,稀缺)仅贡献 1.0%。对层级内不平等、分散性和分配偏差的统计分析证实,这种不平衡是极端的和系统性的。我们的结果为多语言 LLM 的数据集管理和分层感知评估提供了原则框架。