论文

无形态的对象:数学LLM不表示的东西

Objects Without Morphisms: What LLMs for Mathematics Do Not Represent

模型评测模型行为与机制分析

摘要

大语言模型在竞赛数学上达到专家级表现,主要靠围绕其布置的搜索量:候选解被大量采样、仅当外部标准接受时保留。这样的过程改善了幸存的结果,却未触及模型表示了什么。我们在不存在外部标准之处考察该问题:在相邻子领域的方言间翻译陈述——保真取决于内容被断言的一般性层级。源文本把该层级隐含在词汇中,忠实翻译必须从理论间关系恢复它。我们引入一个工具:以独立盲队列编码真值、内容与范围,以无裁判的度量判断重写是否陈述了源中隐含的假设,并以植入阳性对照建立其敏感度。跨四族七个模型:向一般框架翻译在60.6%的重写中放宽量化域、无一收窄;向具体框架翻译收窄28.3%、放宽仅0.3%。能阻止它的假设在21.6%的模型重写与4.2%的人类陈述中被陈述。能力不支配这种不对称:它出现在每个受测模型中,且最能干的模型放宽最少。它在按预注册规则留出的一半基准及数学家撰写的陈述上复现。指示模型陈述其所需的每个假设会提高该比率但不改变其对方向的敏感度。我们论证:这些系统获得了子领域词汇间的对象级对应,却没有使理论间翻译把假设带到假设的约束。