论文

确定性总结与概率性总结:以设计模式为中心的 Java 代码的实证权衡研究

Deterministic vs. Probabilistic Summarisation: An Empirical Trade-off Study in Design Pattern Centric Java Code

模型评测模型能力评测

摘要

背景:自动代码摘要支持程序理解和文档编制,但确定性(基于启发式)和概率性(基于 LLM)管道的相对优势和局限性仍不清楚。目的:本文对这些范式进行了受控的实证比较,以进行面向意图的设计模式代码摘要。方法:使用以设计模式为中心的 Java 代码作为结构化测试平台(来自三个开源存储库的 150 个文件,涵盖九种模式),我们比较了基于规则的自然语言生成 (NLG) 管道、基于软件词使用模型 (SWUM) 的方法以及基于 Mixtral LLM 的概率管道。使用 BERTScore 和余弦相似度根据人类参考对摘要进行评估,并辅以 Llama 3 在五个维度上生成的基于标题的判断:准确性、简洁性、充分性、代码上下文感知和设计模式保真度。统计分析包括 Wilcoxon 符号秩检验(具有效应大小)、带有事后修正的 Friedman 检验以及用于评估标题一致性敏感性分析的 Spearman 相关性。结果:概率摘要显示出更强的语义对齐和更丰富的上下文覆盖范围,而确定性方法则产生更简洁且完全可重现的输出。提示灵敏度和多次运行分析表明 LLM 输出存在变化,但相对趋势保持稳定。结论:出现了明显的权衡:概率方法有利于语义深度和上下文准确性,而确定性管道则更倾向于简洁性和可重复性。这些发现为选择代码摘要技术提供了实用指导。