论文
为未言明者评分:用LLM评估量子场论与弦论中的默会推理
Grading the Unspoken: Evaluating Tacit Reasoning in Quantum Field Theory and String Theory with LLMs
摘要
大语言模型在数学和物理的许多领域展现出令人印象深刻的表现。一个自然的问题是,这类模型能否支撑量子场论和弦论等高度抽象理论领域的研究。评估这一可能性面临一个直接挑战:这些领域的正确性是分层的、默会的,且根本上是非二元的。标准的答案匹配指标无法捕捉中间概念步骤是否得到恰当重构,或隐含的结构约束是否得到遵守。我们构建了一个由专家精选的紧凑数据集,包含涵盖量子场论和弦论核心领域的十二个问题,并引入五级评分量表,区分论断正确性、关键概念意识、推理链存在性、默会步骤重构和拓展发挥。对多个当代LLM的评估显示,在稳定概念框架内的显式推导上表现接近满分,但当任务需要重构被省略的推理步骤或在全局一致性约束下重组表示时,性能出现系统性下降。这些失败不仅源于缺失中间步骤,还源于表示选择的不稳定:模型常常未能识别出化解隐含张力所需的正确概念框架。我们认为,高度抽象的理论物理为审视当前评估范式的认识论极限提供了一个独特而灵敏的透镜。
