论文
大语言模型 在确定性编程任务上的准确性、稳定性和重复运行可靠性
Accuracy, Stability, and Repeated-Run Reliability of Large Language Models on Deterministic Programming Tasks
摘要
运行级别通过率比免重试覆盖率高出多达 17.8 个百分点,而对于中等性能的系统来说,差距最大。我们使用编程任务作为具体的测试平台,在确定性文本条件生成的 大语言模型 (LLM) 评估中研究了这种准确性-稳定性关系。标准代码生成基准强调单次运行的准确性或重复采样下的最终成功,但许多部署设置还需要稳定性:同一任务描述下重复调用的一致结果。我们提出了一个重复运行评估协议,其中包含运行级别准确性、免重试覆盖率和每个问题可变性的指标。在 100 个 LeetCode 式问题的基于新近度的基准上,我们在两个提示模板下评估来自 5 个提供者系列的 16 个模型,每个问题重复运行 5 次,产生 16,000 个评估实例。尽管运行级别通过率和完美稳定性率密切相关 (r=0.985),但通过率始终超过免重试覆盖率,这一差距达到 17.8 个百分点,即使在紧密匹配的系统中,模型排名也会发生逆转。即时效果取决于模型,而不是一律有益。这些结果表明,重复运行稳定性分析是确定性文本条件生成任务的传统准确性报告的必要补充。