论文

TPS-CalcBench:面向高超声速热防护系统工程中大语言模型解析计算能力的基准与诊断评估框架

TPS-CalcBench: A Benchmark and Diagnostic Evaluation Framework for LLM Analytical Calculation Competence in Hypersonic Thermal Protection System Engineering

模型评测基准与评测资源

摘要

在安全攸关的航空航天工程中部署大语言模型(LLM)作为推理助手,需要比通用科学基准更严格的评估标准。在高超声速热防护系统(TPS)设计中,驻点热流或边界层计算不准确可能导致灾难性的设计裕度违背。给出数值上合理但物理上无效答案的模型,比拒绝回答的模型更危险。当前的科学基准只测试抽象数学与基础物理,仅评估最终答案,忽略工程推理过程,无法检测此类关键失败。我们提出 TPS-CalcBench,这是首个面向高超声速空气动力学与高温气体动力学中闭式解析计算的诊断基准,这些计算是有经验的 TPS 工程师无需仿真即可完成的。我们的贡献包括:源自 Anderson 教材、含 4 个难度级别与 8 个类别的领域导向任务分类体系;通过 8 维评分细则与经校准并带人工审计的评判器来度量结果准确性与推理质量、以识别“答案对但推理错”问题的双轨评估;从 4560 条原始数据中产出 420 条高置信核心条目与 810 条噪声受控预门控条目的人机协同数据流水线;衡量数据质量对模型排名影响的噪声敏感性分析;以及三种诊断干预方法:DFA-TPS 微调、RAG-EQ 检索接地与 PA-CoT 过程感知提示。对来自 7 个团队的 13 个模型的测试显示出广泛的性能差异(KPI 12.6-87.9)、隐蔽的公式选择缺陷、由数据引起的排名变化以及有效的干预改进,为安全攸关工程中的 LLM 部署评估建立了完整的“诊断-评估-干预”框架。

TPS-CalcBench:面向高超声速热防护系统工程中大语言模型解析计算能力的基准与诊断评估框架:论文配图
图 1:TPS-CalcBench 的数据构建漏斗。该流程从高召回率自动提取到日益严格的质量关卡,最终经过三重评审员的裁决。最终核心集(v4)包含420个经过充分验证的项目;中间 v2 集(810 个项目)用作噪声较大的比较基线。