论文

大语言模型 对软件工程术语的理解不可靠

Large Language Models Have Unreliable Understanding of Software Engineering Terminology

模型评测模型能力评测

摘要

大语言模型 (LLM) 在软件工程 (SE) 中的使用越来越多,但还没有系统的研究来确定这些 LLM 真正理解标准化 SE 术语的程度。缺乏这种理解可能会导致错误沟通和误解,无论是 LLM 使用文本还是人类开发人员对 LLM 生成的文本进行操作。在本文中,我们研究了最先进的 LLM 在多大程度上能够识别 ISO/IEC/IEEE 24765:2017 系统和软件工程 - 词汇中的定义是否正确。我们提示 LLM 既有正确的定义,也有系统地伪造的定义。伪造既是语义性的(关键术语的替换)又是结构性的(删除关键信息)。我们测量分类准确性以及 LLM 生成的推理标记对于理解定义是否有意义。虽然大多数 LLM 能够高精度地检测到伪造的定义,但它们也拒绝了许多正确的定义,这表明存在系统性拒绝偏差,而不是真正的歧视性理解。明确的推理并不能持续改善结果,甚至可能因过度思考而阻碍绩效。我们的工作表明,虽然 LLM 在许多 SE 任务中的表现(包括其代理使用)令人印象深刻,但仍然存在一些基本问题需要了解这将如何影响 SE,包括术语的一致使用。