论文

效率幻觉:基于 LLM 的代码优化中行为校准的形式化和测量

Efficiency Hallucination: Formalizing and Measuring Behavioral Calibration in LLM-Based Code Optimization

模型评测模型行为与机制分析

摘要

将大型语言模型 (LLM) 集成到自动代码优化中会带来严重的可靠性风险,我们将其称为“效率幻觉”:LLM 倾向于对已优化的代码发出带有未经证实的性能声明的非功能性突变。这是由评估陷阱驱动的,其中二进制基准会激励不必要的修改而不是安全放弃。我们提出了一个使用分类惩罚方法的验证框架,并使用 EffiBench 在 9 个模型(GPT、Claude、Gemini)上进行了 180 次优化运行评估。在标准提示下,模型对最佳代码表现出 100% 的过度编辑率。我们的护栏将正确弃权率从 0% 提高到 44.4%,保持次优代码的 100% 编辑率,错误弃权率为零。校准不均匀:GPT-5.4 Mini 接近完美弃权,简单代码的识别比复杂代码更可靠。我们的框架提供了一种免训练机制,可以在部署到生产环境之前减轻 LLM 的过度自信。