论文
用代数陷门探索语言模型中的结构数学推理
Probing Structural Mathematical Reasoning in Language Models with Algebraic Trapdoors
摘要
我们引入了一个用于评估语言模型中的结构数学推理的基准套件,该套件基于 SL(3, Z) 中具有加密风格验证者-证明者不对称性的子组构造问题而构建。每个实例都将有限生成的子组呈现为整数矩阵列表,并要求算术不变量(索引、素数满射或隶属度),构造时信息 (N, K) 以 O(1) 封闭形式固定,但缺少该信息的求解器必须通过 Aschbacher 分类分析或通过未知可判定性的 SL(3, Z) 中的隶属度查询来导出。因此,该基准将具有内在代数先验的模型(阿施巴赫类、麦克劳林定理、属性 (T)、同余子群属性)与依赖通用计算的模型区分开来。我们报告了来自两个最先进模型的五个代表性推理轨迹的实证结果。主要结果:在索引变体上,一个模型花费了 152 分钟的推理,明确地将内核端成员资格问题识别为瓶颈,尝试建设性验证,并以“不知道”弃权,而不是致力于其计算的核心候选——在基准测试旨在探测的开放可判定性边界上展示了校准的元认知。我们认为,该基准暴露了标准答案关键评分合并的模型行为的四向分类(提交正确、提交错误、弃权正确、弃权错误)。