论文

LangChoiceBench:测量和解释 LLM 中的编程语言选择

LangChoiceBench: Measuring and Explaining Programming-Language Choice in LLMs

模型评测基准与评测资源

摘要

大语言模型 (LLM) 已被证明在生成项目级代码时表现出强烈的 Python 偏好,但目前还没有系统的方法来衡量新模型中的这种行为。为了弥补这一差距,我们引入了 LangChoiceBench,这是一个项目级代码生成基准,用于衡量 Python 偏好、推荐实现一致性和语言多样性。 LangChoiceBench 涵盖了 7 个软件领域的 28 个项目,而在这些领域,Python 通常是一个糟糕的默认选择。我们评估了 25 个不同的 LLM,发现 Python 仍然严重过度选择,推荐实现一致性较低,较小的开放权重模型通常表现出更强的 Python 偏好和较低的语言多样性。我们进一步分析了 9,826 个推理轨迹,发现大多数 Python 选择是自动的或主要是由易用性驱动的,而不是明确考虑项目需求。在一组较小但重要的案例中,模型会为选择 Python 制造上下文支持(我们称之为幻象证据的故障模式),或者生成与自己推理中选择的语言相矛盾的代码。