论文
在浮点错误分类上基准测试大语言模型
Benchmarking Large Language Models on Floating-Point Error Classification
摘要
本文考察大语言模型(LLM)在软件代码中静态检测与分类浮点错误的能力。我们引入InterFLOPBench:含90个C内核与1,130个测试样本的基准——跨六类浮点错误(消除、比较、除零、溢出、下溢与NaN)评估LLM、对比14个LLM。评估框架把浮点错误检测当多标签分类问题、以F1度量。最新模型(Qwen 3 32b、Gemini 2.5 Flash、Phi 4 Reasoning、DeepSeek R1T2及gpt-oss 20b与120b)取得大于0.88的总体F1。表现跨错误类别变化、跨显式与隐式错误模式变化。
