论文

Code-MUE:通过基于执行的语义交互图测量代码 LLM 的不确定性

Code-MUE: Measuring Code LLMs' Uncertainty through Execution-based Semantic Interaction Graphs

模型评测评测方法与指标

摘要

随着代码 大语言模型 (LLM) 成为现代软件工程的核心,其固有的随机性带来了巨大的现实风险,即使是很小的错误也可能导致严重的功能、安全或安全后果。因此,可靠的自动化需要能够区分可靠的、有充分支持的预测和随机猜测。然而,现有的不确定性估计方法面临着一个关键的差距:白盒和灰盒技术通常不适用于闭源模型,而标准的“黑盒”文本度量无法捕获代码的独特脆弱性,其中语法变化并不总是意味着语义分歧。为了弥合这种语法语义差距,我们引入了 Code-MUE,这是一个纯粹的黑盒框架,通过基于执行的语义交互图来测量不确定性。与依赖于表面文本相似性的现有方法不同,Code-MUE 基于可观察的运行时行为的不确定性,计算解空间的冯诺依曼熵来量化全局语义多样性。对八个最先进的 LLM 进行的大规模实证研究表明,Code-MUE 与功能正确性实现了很强的负相关性(Spearman 相关性高达 -0.98),显着优于基于词汇和嵌入的基线,同时在实际工作流程中实现了稳健的风险检测和选择性预测。