论文
ThermoQA:评估大语言模型热力学推理的三层基准
ThermoQA: A Three-Tier Benchmark for Evaluating Thermodynamic Reasoning in Large Language Models
摘要
我们提出ThermoQA,一个包含293道开放式工程热力学问题的基准,分为三个层级:物性查询(110题)、部件分析(101题)和完整循环分析(82题)。真值由CoolProp 7.2.0通过程序化计算得到,涵盖水、R-134a和变比热容(variable-cp)空气。六个前沿大语言模型均经过三次独立运行的评估。综合榜单由Claude Opus 4.6(94.1%)、GPT-5.4(93.1%)和Gemini 3.1 Pro(92.5%)领跑。跨层级性能退化范围从2.8个百分点(Opus)到32.5个百分点(MiniMax),证实物性记忆并不意味着热力学推理能力。超临界水、R-134a制冷剂以及联合循环燃气轮机分析可作为天然的区分项,其性能差距达40-60个百分点。多次运行间的σ(标准差)范围在+/-0.1%至+/-2.5%之间,将推理一致性量化为一个独立的评估维度。数据集与代码已在https://huggingface.co/datasets/olivenet/thermoqa开源。
