论文
LinAlg-Bench:揭示LLM数学推理结构性失败模式的法证式基准
LinAlg-Bench: A Forensic Benchmark Revealing Structural Failure Modes in LLM Mathematical Reasoning
摘要
我们提出LinAlg-Bench,一个诊断性基准,在3x3、4x4、5x5矩阵构成的严格维度梯度上评估10个前沿大语言模型的结构化线性代数计算。该基准覆盖9种任务类型、660道经SymPy验证的题目,穷尽式评估了6,600个模型输出。超越二元准确率,LinAlg-Bench引入三阶段自动化法证式流水线,将1,156个失败归类为十种主错误标签及细粒度子类型,揭示LLM的数学失败并非随机,而是受算法类型与矩阵维度结构性约束。我们的核心发现是4x4规模处存在一个急剧的行为阈值:低于该规模时,模型以执行错误失败——符号追踪失败、算术漂移和奇偶错误;高于该规模时,失败转变为计算放弃,模型通过工具角色扮演、约束一致性虚构和结构化幻觉编造响应,而非尝试计算。这种从编造到放弃的转变在所有模型层级与架构中几乎普遍存在,暗示这是工作记忆限制而非知识缺口;三种在3x3中缺席、却出现在4x4和5x5的规模涌现型错误类型支持了这一结论。我们进一步表明,解题策略僵化是5x5行列式准确率的近乎完美的预测因子,将约束感知虚构记录为一种新型结构化幻觉失败模式,并公开发布全部数据、模型输出、错误标签与评审流水线。
