论文

SafeLLM4SE:基于 LLM 的软件工程系统的统计评估和报告

SafeLLM4SE: Statistical Evaluation and Reporting for LLM-based Software Engineering Systems

模型评测评测方法与指标

摘要

大语言模型 (LLM) 越来越多地用于软件工程任务,但其随机行为对其评估的有效性、可重复性和可比性提出了挑战。报告单个输出、平均分数、N 次最佳或 pass@k 性能等传统做法可能会掩盖可变性和估计不确定性,从而可能导致有关系统可靠性的误导性结论。本文介绍了 SafeLLM4SE,这是一种实用方法和报告标准,用于对基于 LLM 的软件工程系统进行统计原理评估。 SafeLLM4SE 没有将生成的输出视为确定性工件,而是将它们视为随机过程的实现,并区分质量、稳定性和估计不确定性。它将自适应采样与置信区间、分布感知统计比较、效应大小以及涵盖模型配置、再现性、评估程序和资源使用的最低报告标准相结合。 SafeLLM4SE 还作为 PyPI 上可用的开源软件包提供,使研究人员和从业者能够重现和扩展该方法。我们通过在 HumanEval(通过功能测试评估编程问题的基准)上比较两个大语言模型来说明其应用。