论文

在浮点错误分类上基准测试大语言模型

Benchmarking Large Language Models on Floating-Point Error Classification

模型评测基准与评测资源

摘要

本文考察大语言模型(LLM)在软件代码中静态检测与分类浮点错误的能力。我们引入InterFLOPBench:含90个C内核与1,130个测试样本的基准——跨六类浮点错误(消除、比较、除零、溢出、下溢与NaN)评估LLM、对比14个LLM。评估框架把浮点错误检测当多标签分类问题、以F1度量。最新模型(Qwen 3 32b、Gemini 2.5 Flash、Phi 4 Reasoning、DeepSeek R1T2及gpt-oss 20b与120b)取得大于0.88的总体F1。表现跨错误类别变化、跨显式与隐式错误模式变化。

在浮点错误分类上基准测试大语言模型:论文配图
图 1:即时工程对 Qwen 3 32b 的影响(F1:0.67 →\rightarrow 0.86 →\rightarrow 0.89)。图 2:即时工程对 Gemma 3 27b 的影响(F1:0.35 →\rightarrow 0.44 →\rightarrow 0.63)。