论文
评估显着类别识别的语言模型
Assessing Language Models for Salient Class Identification
摘要
代码审查要求审查者了解代码更改的核心意图,当提交修改多个类时,这会变得很困难。在此类提交中,一个或多个主要修改的类(称为显着类)可能会引起其他类的修改。准确识别显着类为审阅者提供了一个有效的切入点来导航代码更改并促进程序理解。现有最先进的方法依赖于复杂的程序分析过程,包括抽象语法树(AST)解析、类关系提取、手工特征工程或依赖图构建。为此,我们研究语言模型(LM)是否可以直接从提交中识别显着类,而无需特征工程、图形构建或训练。我们首先构建一个新的数据集 ApacheJavaCM,该数据集源自 ApacheCM 数据集,包含 7,911 个提交和 25,914 个标记类。在此数据集上,我们系统地评估 LM 是否可以直接从提交中识别显着类,并与最强的可再现最先进 (SOTA) 基线进行比较。评估涵盖两个大语言模型(LLM)、GPT-5.4和DeepSeek-V3.2,一个小语言模型(SLM),Qwen3.5-9B,以及三种提示策略:零样本、少样本和思维链。 LM 的性能大大优于基线,同时在提交特征和选定的 LM 之间保持稳定。我们还发现,对于显着类识别任务,9B 参数开源 SLM Qwen3.5-9B 在几次提示下实现的性能与更大的闭源 LLM GPT-5.4 相当。这些结果表明,轻量级、可本地部署的 SLM 是显着类识别任务的可行选择,并且可以减少与依赖闭源 LLM 相关的成本和隐私障碍。